Processus → procédure
Transformer une validation de facture en procédure pour débutant.
Livrable attendu
Procédure complète, règles, exceptions, contrôles.
Contexte fourni
- Facture : vérifier fournisseur, montant, date et commande ; référence absente → achats ; > 5000 € → directeur financier ; sinon responsable de service ; puis dossier comptable ; doublon suspect → ne pas valider et signaler à la comptabilité. (jeu d'entrée synthétique, identique dans les trois modes)
Critères de qualité
- Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
- Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
- Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
- Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
- Absence d'invention : aucun chiffre, exemple, source ou politique inventé.
Dossier expérimental
Dossier reproductible versionné dans le dépôt : docs/lab/01/T15/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.
- README.md
- scenario.md
- context.md
- expected-output.md
- evaluation-rubric.md
- prompt-A.md
- prompt-B.md
- prompt-C.md
- inputs/dataset.md
- baseline.md
Référence humaine
Aucune référence humaine mesurée à ce stade : le gain opérationnel net n'est donc pas calculable pour cette tâche.
Mesures
| Métrique | Valeur | Couverture |
|---|---|---|
| Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable). | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Temps humain total | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Gain opérationnel netAucune baseline mesurée : le gain n'est pas calculable. | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable). | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Reproductibilité0 = très instable, 5 = très stable (score élevé favorable). | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable). | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
Expériences sur cette tâche — couverture : 0 réalisée / 15 attendues — aucune donnée mesurée
Expériences
| Assistant | Mode A | Mode B | Mode C |
|---|---|---|---|
| ChatGPT | non réalisée | non réalisée | non réalisée |
| Claude | non réalisée | non réalisée | non réalisée |
| Gemini | non réalisée | non réalisée | non réalisée |
| Microsoft Copilot | non réalisée | non réalisée | non réalisée |
| Perplexity | non réalisée | non réalisée | non réalisée |
Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.

