SignauxPremiers signaux à venir : nous ne publions rien sans preuve.
Le travail réellement délégable à l'IA
T18DécisionVerdict à établir

3 scénarios stratégiques

Comparer trois orientations avec données financières incomplètes.

Livrable attendu

Bénéfices, risques, prérequis, horizon, réversibilité, questions manquantes, recommandation conditionnelle.

Contexte fourni

  • Agence de 12 personnes. A : spécialisation sectorielle, faible investissement, marché plus petit. B : généraliste, acquisition plus simple, différenciation faible. C : offre logicielle légère, marge potentielle supérieure, investissement et risque produit élevés. (jeu d'entrée synthétique, identique dans les trois modes)

Critères de qualité

  • Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
  • Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
  • Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
  • Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
  • Absence d'invention : aucun chiffre, exemple, source ou politique inventé.

Dossier expérimental

Dossier reproductible versionné dans le dépôt : docs/lab/01/T18/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.

  • README.md
  • scenario.md
  • context.md
  • expected-output.md
  • evaluation-rubric.md
  • prompt-A.md
  • prompt-B.md
  • prompt-C.md
  • inputs/dataset.md
  • baseline.md

Référence humaine

Aucune référence humaine mesurée à ce stade : le gain opérationnel net n'est donc pas calculable pour cette tâche.

Mesures

Moyennes calculées uniquement sur les expériences réellement réalisées.
MétriqueValeurCouverture
Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Temps humain totalnon mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Gain opérationnel netAucune baseline mesurée : le gain n'est pas calculable.non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Reproductibilité0 = très instable, 5 = très stable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences sur cette tâche — couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences

AssistantMode AMode BMode C
ChatGPTnon réaliséenon réaliséenon réalisée
Claudenon réaliséenon réaliséenon réalisée
Gemininon réaliséenon réaliséenon réalisée
Microsoft Copilotnon réaliséenon réaliséenon réalisée
Perplexitynon réaliséenon réaliséenon réalisée

Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.