Cartographier processus
Cartographier un traitement de demandes entrantes.
Verdict de cette tâche
AssistableCartographier processus — Cartographier un traitement de demandes entrantes. Décidé par qualité 3,6/5 tenue, mais supervision 2,3/5 et risque 2,1/5 sur 15 expériences. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +6,7 min face à la référence humaine de 22,7 min. Contrainte de la fiche : Livrable attendu : Étapes, acteurs, décisions, exceptions, entrées/sorties, frictions ; pas de solution prématurée.
Un verdict est une recommandation fondée sur les mesures affichées plus bas, pas un niveau de preuve.
Livrable attendu
Étapes, acteurs, décisions, exceptions, entrées/sorties, frictions ; pas de solution prématurée.
Contexte fourni
- Email reçu ; l'assistante classe ; commercial ou support ; demande incomplète → demande d'informations ; urgence parfois non signalée ; le commercial consulte parfois l'historique ; le support clôture ; aucun SLA formel. (jeu d'entrée synthétique, identique dans les trois modes)
Critères de qualité
- Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
- Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
- Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
- Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
- Absence d'invention : aucun chiffre, exemple, source ou politique inventé.
Dossier expérimental
Dossier reproductible versionné dans le dépôt : docs/lab/01/T12/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.
- README.md
- scenario.md
- context.md
- expected-output.md
- evaluation-rubric.md
- prompt-A.md
- prompt-B.md
- prompt-C.md
- inputs/dataset.md
- baseline.md
Référence humaine
Temps de référence mesuré : 22.7 min — Exécution simulée dans les conditions de la fiche : jeu d'entrée du corpus, aucun assistant, aucune source externe.
Mesures
| Métrique | Valeur | Couverture |
|---|---|---|
| Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable). | 3.6 / 5 | couverture : 15 réalisées / 15 attendues |
| Temps humain total | 16 min | couverture : 15 réalisées / 15 attendues |
| Gain opérationnel net | 6.7 min | couverture : 15 réalisées / 15 attendues |
| Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable). | 2.3 / 5 | couverture : 15 réalisées / 15 attendues |
| Reproductibilité0 = très instable, 5 = très stable (score élevé favorable). | 4 / 5 | couverture : 15 réalisées / 15 attendues |
| Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable). | 2.1 / 5 | couverture : 15 réalisées / 15 attendues |
Expériences sur cette tâche — couverture : 15 réalisées / 15 attendues
Expériences
| Assistant | Mode A | Mode B | Mode C |
|---|---|---|---|
| ChatGPT | 2 / 5 | 4 / 5 | 4 / 5 |
| Claude | 3 / 5 | 4 / 5 | 4 / 5 |
| Gemini | 3 / 5 | 4 / 5 | 4 / 5 |
| Microsoft Copilot | 3 / 5 | 4 / 5 | 4 / 5 |
| Perplexity | 3 / 5 | 4 / 5 | 4 / 5 |
Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.
Contenus dérivés de cette tâche
Les publications qui exploitent directement les mesures de cette tâche.
- Décision
Automatiser un processus : à quelles conditions, et à partir de quand
Dans notre campagne, documenter un processus avec l'IA fonctionne (3,60 / 5). L'automatiser échoue (2,87 / 5, douze erreurs critiques). L'écart dessine des conditions de passage.
- Guide
Comment tester une tâche avec l'IA dans une PME : protocole A/B/C
La méthode du Lab #1, transposée à l'échelle d'une PME : une tâche, une référence humaine, trois modes d'usage, une demi-journée, une décision.
Ce qu'une mesure réelle devrait confirmer
Ces points sont dérivés des observations simulées de cette tâche. Aucune exécution réelle n'a encore eu lieu : rien ici n'est acquis.
- Que le temps de référence utilisé (22.7 min, généré et non chronométré) soit remplacé par une baseline humaine réellement mesurée. Gain net simulé : 6.7 min.
- Que la supervision nécessaire (2.3 / 5, score élevé défavorable) corresponde au travail de reprise réellement constaté.
- Que la qualité observée en simulation (3.6 / 5) se retrouve sur une exécution réelle, sur 15 expérience(s) / 15, faute de quoi le verdict de la tâche ne tient pas.

