Workflow humain + IA
Concevoir un workflow sûr pour accélérer le tri et préparer les réponses.
Verdict de cette tâche
À conserver humainWorkflow humain + IA — Concevoir un workflow sûr pour accélérer le tri et préparer les réponses. Décidé par erreurs critiques sur 33 % des expériences et risque moyen 3,6/5 avec supervision 3,5/5. Le mode B est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +3,8 min face à la référence humaine de 23,5 min. Contrainte de la fiche : Aucune réponse client ne doit être envoyée sans contrôle humain.
Un verdict est une recommandation fondée sur les mesures affichées plus bas, pas un niveau de preuve.
Livrable attendu
Déclencheur, IA, contrôles, exceptions, sorties, arrêts, journalisation.
Contexte fourni
- Emails + historique client. Objectif : accélérer le tri et la préparation. Aucune réponse automatique ; urgences traitées par un humain ; incertitude signalée ; journalisation obligatoire. (jeu d'entrée synthétique, identique dans les trois modes)
Critères de qualité
- Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
- Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
- Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
- Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
- Absence d'invention : aucun chiffre, exemple, source ou politique inventé.
Points de vigilance
- Aucune réponse client ne doit être envoyée sans contrôle humain.
Dossier expérimental
Dossier reproductible versionné dans le dépôt : docs/lab/01/T14/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.
- README.md
- scenario.md
- context.md
- expected-output.md
- evaluation-rubric.md
- prompt-A.md
- prompt-B.md
- prompt-C.md
- inputs/dataset.md
- baseline.md
Référence humaine
Temps de référence mesuré : 23.5 min — Exécution simulée dans les conditions de la fiche : jeu d'entrée du corpus, aucun assistant, aucune source externe.
Mesures
| Métrique | Valeur | Couverture |
|---|---|---|
| Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable). | 3.4 / 5 | couverture : 15 réalisées / 15 attendues |
| Temps humain total | 19.7 min | couverture : 15 réalisées / 15 attendues |
| Gain opérationnel net | 3.8 min | couverture : 15 réalisées / 15 attendues |
| Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable). | 3.5 / 5 | couverture : 15 réalisées / 15 attendues |
| Reproductibilité0 = très instable, 5 = très stable (score élevé favorable). | 3.4 / 5 | couverture : 15 réalisées / 15 attendues |
| Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable). | 3.6 / 5 | couverture : 15 réalisées / 15 attendues |
Expériences sur cette tâche — couverture : 15 réalisées / 15 attendues
Expériences
| Assistant | Mode A | Mode B | Mode C |
|---|---|---|---|
| ChatGPT | 3 / 5 | 4 / 5 | 4 / 5 |
| Claude | 3 / 5 | 4 / 5 | 4 / 5 |
| Gemini | 3 / 5 | 4 / 5 | 4 / 5 |
| Microsoft Copilot | 2 / 5 | 3 / 5 | 4 / 5 |
| Perplexity | 2 / 5 | 4 / 5 | 3 / 5 |
Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.
Contenus dérivés de cette tâche
Les publications qui exploitent directement les mesures de cette tâche.
- Décision
Automatiser un processus : à quelles conditions, et à partir de quand
Dans notre campagne, documenter un processus avec l'IA fonctionne (3,60 / 5). L'automatiser échoue (2,87 / 5, douze erreurs critiques). L'écart dessine des conditions de passage.
- Dossier vivant
Contrôle, risque et responsabilité
Qui répond de ce que produit l'IA dans l'entreprise ? Nous suivons les dispositifs de contrôle, les erreurs qui échappent à la relecture et les tâches qui doivent rester sous décision humaine.
Ce qu'une mesure réelle devrait confirmer
Ces points sont dérivés des observations simulées de cette tâche. Aucune exécution réelle n'a encore eu lieu : rien ici n'est acquis.
- Que le temps de référence utilisé (23.5 min, généré et non chronométré) soit remplacé par une baseline humaine réellement mesurée. Gain net simulé : 3.8 min.
- Que le risque (3.6 / 5, score élevé défavorable) et les 9 erreur(s) critique(s) relevée(s) en simulation se vérifient sur des livrables réels.
- Que la qualité observée en simulation (3.4 / 5) se retrouve sur une exécution réelle, sur 15 expérience(s) / 15, faute de quoi le verdict de la tâche ne tient pas.

