Choisir un SaaS
Décider entre trois outils sous contraintes.
Livrable attendu
Matrice, critère bloquant, incertitudes, recommandation conditionnelle.
Contexte fourni
- Besoin : 25 users, budget ≤ 500 €/mois, SSO souhaité, export obligatoire, intégration, support FR apprécié. A 420, SSO/export/intégration oui, support FR par email. B 310, pas de SSO, export, API, support anglais, coût API inconnu. C 480, SSO, export limité, intégration native, support FR par téléphone. (jeu d'entrée synthétique, identique dans les trois modes)
Critères de qualité
- Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
- Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
- Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
- Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
- Absence d'invention : aucun chiffre, exemple, source ou politique inventé.
Dossier expérimental
Dossier reproductible versionné dans le dépôt : docs/lab/01/T16/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.
- README.md
- scenario.md
- context.md
- expected-output.md
- evaluation-rubric.md
- prompt-A.md
- prompt-B.md
- prompt-C.md
- inputs/dataset.md
- baseline.md
Référence humaine
Aucune référence humaine mesurée à ce stade : le gain opérationnel net n'est donc pas calculable pour cette tâche.
Mesures
| Métrique | Valeur | Couverture |
|---|---|---|
| Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable). | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Temps humain total | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Gain opérationnel netAucune baseline mesurée : le gain n'est pas calculable. | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable). | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Reproductibilité0 = très instable, 5 = très stable (score élevé favorable). | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
| Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable). | non mesuré | couverture : 0 réalisée / 15 attendues — aucune donnée mesurée |
Expériences sur cette tâche — couverture : 0 réalisée / 15 attendues — aucune donnée mesurée
Expériences
| Assistant | Mode A | Mode B | Mode C |
|---|---|---|---|
| ChatGPT | non réalisée | non réalisée | non réalisée |
| Claude | non réalisée | non réalisée | non réalisée |
| Gemini | non réalisée | non réalisée | non réalisée |
| Microsoft Copilot | non réalisée | non réalisée | non réalisée |
| Perplexity | non réalisée | non réalisée | non réalisée |
Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.

