SignauxPremiers signaux à venir : nous ne publions rien sans preuve.
Le travail réellement délégable à l'IA
T04AnalyseVerdict à établir

Contrat → points d'attention

Identifier les clauses à vérifier sans donner d'avis juridique.

Livrable attendu

Points à vérifier, questions ouvertes, risques opérationnels potentiels ; aucune conclusion juridique.

Contexte fourni

  • Engagement 24 mois ; renouvellement automatique 12 mois avec préavis 90 j ; révision tarifaire selon indice non précisé ; données UE ; résiliation anticipée : mensualités restantes sauf manquement grave ; SLA 99,5 % ; sous-traitance possible ; réversibilité dans une annexe absente. (jeu d'entrée synthétique, identique dans les trois modes)

Critères de qualité

  • Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
  • Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
  • Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
  • Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
  • Absence d'invention : aucun chiffre, exemple, source ou politique inventé.

Points de vigilance

  • Aucune conclusion juridique ne doit être produite ni publiée à partir de cette tâche.

Dossier expérimental

Dossier reproductible versionné dans le dépôt : docs/lab/01/T04/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.

  • README.md
  • scenario.md
  • context.md
  • expected-output.md
  • evaluation-rubric.md
  • prompt-A.md
  • prompt-B.md
  • prompt-C.md
  • inputs/dataset.md
  • baseline.md

Référence humaine

Aucune référence humaine mesurée à ce stade : le gain opérationnel net n'est donc pas calculable pour cette tâche.

Mesures

Moyennes calculées uniquement sur les expériences réellement réalisées.
MétriqueValeurCouverture
Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Temps humain totalnon mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Gain opérationnel netAucune baseline mesurée : le gain n'est pas calculable.non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Reproductibilité0 = très instable, 5 = très stable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences sur cette tâche — couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences

AssistantMode AMode BMode C
ChatGPTnon réaliséenon réaliséenon réalisée
Claudenon réaliséenon réaliséenon réalisée
Gemininon réaliséenon réaliséenon réalisée
Microsoft Copilotnon réaliséenon réaliséenon réalisée
Perplexitynon réaliséenon réaliséenon réalisée

Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.