SignauxPremiers signaux à venir : nous ne publions rien sans preuve.
Le travail réellement délégable à l'IA
T17DécisionVerdict à établir

ROI projet IA

Évaluer un ROI sans inventer les variables manquantes.

Livrable attendu

Calculs défendables, faits/hypothèses, données à mesurer, sensibilité.

Contexte fourni

  • 1200 emails/mois ; 4 min/email (estimation non chronométrée) ; 60 % automatisable (hypothèse) ; outil 350 €/mois ; setup 2500 € ; coût chargé 35 €/h ; supervision 45 min/jour (hypothèse) ; 20 jours/mois ; taux d'erreur acceptable inconnu. (jeu d'entrée synthétique, identique dans les trois modes)

Critères de qualité

  • Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
  • Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
  • Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
  • Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
  • Absence d'invention : aucun chiffre, exemple, source ou politique inventé.

Points de vigilance

  • Les hypothèses doivent rester distinguées des faits : aucun ROI ne doit être présenté comme mesuré.

Dossier expérimental

Dossier reproductible versionné dans le dépôt : docs/lab/01/T17/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.

  • README.md
  • scenario.md
  • context.md
  • expected-output.md
  • evaluation-rubric.md
  • prompt-A.md
  • prompt-B.md
  • prompt-C.md
  • inputs/dataset.md
  • baseline.md

Référence humaine

Aucune référence humaine mesurée à ce stade : le gain opérationnel net n'est donc pas calculable pour cette tâche.

Mesures

Moyennes calculées uniquement sur les expériences réellement réalisées.
MétriqueValeurCouverture
Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Temps humain totalnon mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Gain opérationnel netAucune baseline mesurée : le gain n'est pas calculable.non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Reproductibilité0 = très instable, 5 = très stable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences sur cette tâche — couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences

AssistantMode AMode BMode C
ChatGPTnon réaliséenon réaliséenon réalisée
Claudenon réaliséenon réaliséenon réalisée
Gemininon réaliséenon réaliséenon réalisée
Microsoft Copilotnon réaliséenon réaliséenon réalisée
Perplexitynon réaliséenon réaliséenon réalisée

Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.