SignauxPremiers signaux à venir : nous ne publions rien sans preuve.
Le travail réellement délégable à l'IA
T01AnalyseVerdict à établir

Brief désordonné → synthèse

Extraire faits, décisions, contradictions et prochaines étapes d'un brief PME désordonné.

Livrable attendu

Synthèse : faits ; décisions/non-décisions ; contradictions ; informations manquantes ; prochaines étapes.

Contexte fourni

  • Atelier Nord : objectif réduire les tickets répétitifs ; portail client envisagé avant septembre ; budget annoncé 8k puis 12k si réduction >20 % ; 42 % des tickets concernent 3 demandes ; accès humain premium obligatoire ; aucun outil choisi. (jeu d'entrée synthétique, identique dans les trois modes)

Critères de qualité

  • Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
  • Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
  • Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
  • Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
  • Absence d'invention : aucun chiffre, exemple, source ou politique inventé.

Dossier expérimental

Dossier reproductible versionné dans le dépôt : docs/lab/01/T01/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.

  • README.md
  • scenario.md
  • context.md
  • expected-output.md
  • evaluation-rubric.md
  • prompt-A.md
  • prompt-B.md
  • prompt-C.md
  • inputs/dataset.md
  • baseline.md

Référence humaine

Aucune référence humaine mesurée à ce stade : le gain opérationnel net n'est donc pas calculable pour cette tâche.

Mesures

Moyennes calculées uniquement sur les expériences réellement réalisées.
MétriqueValeurCouverture
Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Temps humain totalnon mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Gain opérationnel netAucune baseline mesurée : le gain n'est pas calculable.non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Reproductibilité0 = très instable, 5 = très stable (score élevé favorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable).non mesuré

couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences sur cette tâche — couverture : 0 réalisée / 15 attendues — aucune donnée mesurée

Expériences

AssistantMode AMode BMode C
ChatGPTnon réaliséenon réaliséenon réalisée
Claudenon réaliséenon réaliséenon réalisée
Gemininon réaliséenon réaliséenon réalisée
Microsoft Copilotnon réaliséenon réaliséenon réalisée
Perplexitynon réaliséenon réaliséenon réalisée

Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.