SignauxPremiers signaux à venir : nous ne publions rien sans preuve.
Le travail réellement délégable à l'IA
T19LimitesVerdict à établir

Contradictions métier

Traiter un problème ambigu sans inventer une politique.

Livrable attendu

Contradictions, décisions métier manquantes, informations à collecter, aucune règle présentée comme validée.

Contexte fourni

  • A : les urgences passent immédiatement. B : aucune définition de l'urgence. A : les clients premium sont toujours prioritaires. C : des non-premium peuvent avoir des incidents critiques. Objectif : automatiser la priorisation. Aucun SLA, aucune politique, aucun historique. (jeu d'entrée synthétique, identique dans les trois modes)

Critères de qualité

  • Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
  • Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
  • Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
  • Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
  • Absence d'invention : aucun chiffre, exemple, source ou politique inventé.

Points de vigilance

  • Aucune règle de priorisation ne doit être produite comme si elle avait été validée par l'entreprise.

Dossier expérimental

Dossier reproductible versionné dans le dépôt : docs/lab/01/T19/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.

  • README.md
  • scenario.md
  • context.md
  • expected-output.md
  • evaluation-rubric.md
  • prompt-A.md
  • prompt-B.md
  • prompt-C.md
  • inputs/dataset.md
  • baseline.md

Référence humaine

Aucune référence humaine mesurée à ce stade : le gain opérationnel net n'est donc pas calculable pour cette tâche.

Mesures

Moyennes calculées uniquement sur les expériences réellement réalisées.
MétriqueValeurCouverture
Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Temps humain totalnon mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Gain opérationnel netAucune baseline mesurée : le gain n'est pas calculable.non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Reproductibilité0 = très instable, 5 = très stable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences sur cette tâche — couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences

AssistantMode AMode BMode C
ChatGPTnon réaliséenon réaliséenon réalisée
Claudenon réaliséenon réaliséenon réalisée
Gemininon réaliséenon réaliséenon réalisée
Microsoft Copilotnon réaliséenon réaliséenon réalisée
Perplexitynon réaliséenon réaliséenon réalisée

Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.