ROI projet IA
Évaluer un ROI sans inventer les variables manquantes.
Verdict de cette tâche
À conserver humainROI projet IA — Évaluer un ROI sans inventer les variables manquantes. Décidé par erreurs critiques sur 67 % des expériences et risque moyen 3,5/5 avec supervision 3,6/5. Le mode C est le plus favorable (qualité 3,4/5), le mode A le moins favorable. Gain net moyen +1,8 min face à la référence humaine de 22,8 min. Contrainte de la fiche : Les hypothèses doivent rester distinguées des faits : aucun ROI ne doit être présenté comme mesuré.
Un verdict est une recommandation fondée sur les mesures affichées plus bas, pas un niveau de preuve.
Livrable attendu
Calculs défendables, faits/hypothèses, données à mesurer, sensibilité.
Contexte fourni
- 1200 emails/mois ; 4 min/email (estimation non chronométrée) ; 60 % automatisable (hypothèse) ; outil 350 €/mois ; setup 2500 € ; coût chargé 35 €/h ; supervision 45 min/jour (hypothèse) ; 20 jours/mois ; taux d'erreur acceptable inconnu. (jeu d'entrée synthétique, identique dans les trois modes)
Critères de qualité
- Exactitude : ce qui est affirmé est correct au regard des entrées fournies.
- Fidélité aux entrées : aucune donnée, contrainte ou décision hors du jeu d'entrée.
- Gestion de l'incertitude : ce qui manque ou reste à vérifier est signalé comme tel.
- Utilité opérationnelle : le livrable est exploitable dans le contexte décrit.
- Absence d'invention : aucun chiffre, exemple, source ou politique inventé.
Points de vigilance
- Les hypothèses doivent rester distinguées des faits : aucun ROI ne doit être présenté comme mesuré.
Dossier expérimental
Dossier reproductible versionné dans le dépôt : docs/lab/01/T17/. Il contient le scénario, le contexte, le jeu d'entrée synthétique, le livrable attendu, la grille d'évaluation et les trois prompts de référence (modes A, B et C). Les entrées sont synthétiques et ne décrivent aucune entreprise réelle ; aucun résultat n'y figure.
- README.md
- scenario.md
- context.md
- expected-output.md
- evaluation-rubric.md
- prompt-A.md
- prompt-B.md
- prompt-C.md
- inputs/dataset.md
- baseline.md
Référence humaine
Temps de référence mesuré : 22.8 min — Exécution simulée dans les conditions de la fiche : jeu d'entrée du corpus, aucun assistant, aucune source externe.
Mesures
| Métrique | Valeur | Couverture |
|---|---|---|
| Qualité moyenne0 = inutilisable, 5 = directement exploitable (score élevé favorable). | 2.9 / 5 | couverture : 15 réalisées / 15 attendues |
| Temps humain total | 21 min | couverture : 15 réalisées / 15 attendues |
| Gain opérationnel net | 1.8 min | couverture : 15 réalisées / 15 attendues |
| Supervision0 = aucune intervention nécessaire, 5 = intervention humaine très importante (score élevé défavorable). | 3.6 / 5 | couverture : 15 réalisées / 15 attendues |
| Reproductibilité0 = très instable, 5 = très stable (score élevé favorable). | 3.3 / 5 | couverture : 15 réalisées / 15 attendues |
| Risque0 = risque négligeable, 5 = risque critique (score élevé défavorable). | 3.5 / 5 | couverture : 15 réalisées / 15 attendues |
Expériences sur cette tâche — couverture : 15 réalisées / 15 attendues
Expériences
| Assistant | Mode A | Mode B | Mode C |
|---|---|---|---|
| ChatGPT | 2 / 5 | 3 / 5 | 4 / 5 |
| Claude | 2 / 5 | 3 / 5 | 4 / 5 |
| Gemini | 2 / 5 | 3 / 5 | 3 / 5 |
| Microsoft Copilot | 2 / 5 | 4 / 5 | 3 / 5 |
| Perplexity | 2 / 5 | 3 / 5 | 3 / 5 |
Chaque expérience conserve son prompt exact et sa sortie brute hors du site ; seules les mesures sont publiées ici.
Contenus dérivés de cette tâche
Les publications qui exploitent directement les mesures de cette tâche.
- Analyse
Le gain de temps de l'IA existe, mais il est petit et inégal
5,1 minutes de gain net moyen par expérience, 19 tâches gagnantes sur 20, et une tâche où l'assistance coûte 3,6 minutes de plus. La moyenne ne dit presque rien.
- Analyse
Plus la tâche engage une décision, moins l'assistance est fiable
De la production de contenu à la décision stratégique, la qualité passe de 3,95 à 3,04 sur 5 et la supervision requise grimpe de 2,07 à 3,40. La pente est régulière.
- Décision
Que déléguer à l'IA dans une PME : la grille de tri en quatre niveaux
Sur les vingt tâches du corpus, deux sont classées automatisables, huit assistables, une accélérable et neuf à conserver humaines. Voici comment appliquer ce tri à vos propres tâches.
- Dossier vivant
Que faut-il déléguer à l'IA, et que faut-il garder ?
Nous suivons cette question avec un protocole versionné et un corpus de vingt tâches professionnelles. L'état actuel repose sur une campagne simulée : le registre d'exécution réelle est encore vide, et nous le signalons à chaque mise à jour.
- Dossier vivant
Le vrai coût de l'IA dans une PME
Ce que l'IA coûte réellement, une fois le temps humain compté. Nous suivons l'écart entre le prix affiché des outils et le coût d'usage constaté, et nous documentons ce qui n'est pas encore mesurable.
- Guide
Comment tester une tâche avec l'IA dans une PME : protocole A/B/C
La méthode du Lab #1, transposée à l'échelle d'une PME : une tâche, une référence humaine, trois modes d'usage, une demi-journée, une décision.
Ce qu'une mesure réelle devrait confirmer
Ces points sont dérivés des observations simulées de cette tâche. Aucune exécution réelle n'a encore eu lieu : rien ici n'est acquis.
- Que le temps de référence utilisé (22.8 min, généré et non chronométré) soit remplacé par une baseline humaine réellement mesurée. Gain net simulé : 1.8 min.
- Que la supervision nécessaire (3.6 / 5, score élevé défavorable) corresponde au travail de reprise réellement constaté.
- Que la qualité observée en simulation (2.9 / 5) se retrouve sur une exécution réelle, sur 15 expérience(s) / 15, faute de quoi le verdict de la tâche ne tient pas.

