Le travail réellement délégable à l'IA
T04AnalyseÀ conserver humain

Contrat → points d'attention

Identifier les clauses à vérifier sans donner d'avis juridique.

Verdict de cette tâche

À conserver humain

Contrat → points d'attention — Identifier les clauses à vérifier sans donner d'avis juridique. Décidé par erreurs critiques sur 33 % des expériences et risque moyen 3,4/5 avec supervision 3,3/5. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +2,3 min face à la référence humaine de 18,5 min. Contrainte de la fiche : Aucune conclusion juridique ne doit être produite ni publiée à partir de cette tâche.

Un verdict est une recommandation fondée sur les mesures affichées plus bas, pas un niveau de preuve.

Livrable attendu

Points à vérifier, questions ouvertes, risques opérationnels potentiels ; aucune conclusion juridique.

Contexte fourni

  • Engagement 24 mois ; renouvellement automatique 12 mois avec préavis 90 j ; révision tarifaire selon indice non précisé ; données UE ; résiliation anticipée : mensualités restantes sauf manquement grave ; SLA 99,5 % ; sous-traitance possible ; réversibilité dans une annexe absente. (jeu d'entrée synthétique, identique dans les trois modes)

Critères de qualité

  • Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
  • Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
  • Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
  • Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
  • Absence d'invention : aucun chiffre, exemple, source ou politique inventé.

Points de vigilance

  • Aucune conclusion juridique ne doit être produite ni publiée à partir de cette tâche.

Dossier expérimental

Dossier reproductible versionné dans le dépôt : docs/lab/01/T04/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.

  • README.md
  • scenario.md
  • context.md
  • expected-output.md
  • evaluation-rubric.md
  • prompt-A.md
  • prompt-B.md
  • prompt-C.md
  • inputs/dataset.md
  • baseline.md

Référence humaine

Temps de référence mesuré : 18.5 min — Exécution simulée dans les conditions de la fiche : jeu d'entrée du corpus, aucun assistant, aucune source externe.

Mesures

Moyennes calculées uniquement sur les expériences réellement réalisées.
MétriqueValeurCouverture
Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable).3.3 / 5

couverture : 15 réalisées / 15 attendues

Temps humain total16.2 min

couverture : 15 réalisées / 15 attendues

Gain opérationnel net2.3 min

couverture : 15 réalisées / 15 attendues

Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable).3.3 / 5

couverture : 15 réalisées / 15 attendues

Reproductibilité0 = très instable, 5 = très stable (score élevé favorable).3.5 / 5

couverture : 15 réalisées / 15 attendues

Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable).3.4 / 5

couverture : 15 réalisées / 15 attendues

Expériences sur cette tâche — couverture : 15 réalisées / 15 attendues

Expériences

AssistantMode AMode BMode C
ChatGPT3 / 54 / 54 / 5
Claude2 / 53 / 54 / 5
Gemini3 / 54 / 54 / 5
Microsoft Copilot2 / 54 / 53 / 5
Perplexity3 / 53 / 54 / 5

Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.

Contenus dérivés de cette tâche

Les publications qui exploitent directement les mesures de cette tâche.

Ce qu'une mesure réelle devrait confirmer

Ces points sont dérivés des observations simulées de cette tâche. Aucune exécution réelle n'a encore eu lieu : rien ici n'est acquis.

  • Que le temps de référence utilisé (18.5 min, généré et non chronométré) soit remplacé par une baseline humaine réellement mesurée. Gain net simulé : 2.3 min.
  • Que le risque (3.4 / 5, score élevé défavorable) et les 7 erreur(s) critique(s) relevée(s) en simulation se vérifient sur des livrables réels.
  • Que la qualité observée en simulation (3.3 / 5) se retrouve sur une exécution réelle, sur 15 expérience(s) / 15, faute de quoi le verdict de la tâche ne tient pas.