Rapport analytique — Lab #1
Lecture intégrale de la campagne active : 20 tâches, 5 assistants, 3 modes, protocole v1.3. Chaque valeur est calculée à partir de la source de données active — aucune valeur n'est saisie dans ce rapport, et une mesure absente reste affichée « non mesuré ». En campagne simulée, aucun assistant n'a été interrogé et aucune baseline n'a été chronométrée par un humain : les temps de référence, comme les sorties, sont produits par le générateur.
Exporter ce rapport
Le fichier Markdown contient l'intégralité du rapport, avec ses couvertures et son statut de preuve. L'ouverture dans un assistant copie un prompt prêt à coller : il ne remplace pas le rapport complet, qui peut être joint via le fichier téléchargé. Le statut de campagne simulée est repris dans les deux exports.
0. Synthèse exécutive
Lecture courte du rapport. La colonne de gauche ne contient que des observations de la source active, la colonne du milieu ce qu'elles signifieraient, la colonne de droite ce qu'une exécution réelle doit trancher.
Résultat simulé
- Qualité moyenne par mode : sans contexte 2.7 / 5, avec contexte 3.8 / 5, avec exigence sémantique 4 / 5.Couverture : 100 / 100
- Supervision moyenne 2.7 / 5 (score élevé défavorable) pour une qualité moyenne de 3.5 / 5.Couverture : 300 / 300
- Temps humain total moyen 15.5 min et gain opérationnel net moyen 5.1 min ; 19 tâche(s) à gain positif et 1 à gain négatif sur 20 référence(s) disponible(s).Couverture : 300 / 300
- Verdicts établis 20 / 20 : 2 automatisable(s), 8 assistable(s), 9 à conserver humaine(s).Couverture : 20 / 20
- Risque moyen 2.5 / 5 (score élevé défavorable). Détection d'anomalie : 20 détectée(s), 25 manquée(s) sur 45 expérience(s) applicable(s) ; 255 expérience(s) sans anomalie prévue.Couverture : 45 / 45
- Coût total calculable sur 180 expérience(s) / 300 ; 120 expérience(s) déclarée(s) non mesurable(s).Couverture : 180 / 300
- Reproductibilité moyenne 3.5 / 5 (score élevé favorable).Couverture : 300 / 300
Interprétation
- Dans cette campagne simulée, ce qui distingue le plus les résultats est le contexte fourni, pas l'outil choisi. À vérifier en réel avant toute décision d'outillage.
- Un livrable assisté reste à contrôler : la simulation ne décrit aucun scénario sans reprise humaine.
- Le gain de temps simulé est réel mais borné, et il n'est pas homogène selon les tâches. Aucun de ces temps n'a été chronométré sur une exécution réelle.
- La délégation utile est sélective : la majorité des tâches du corpus relève de l'assistance ou du maintien humain, pas de l'automatisation.
- Les erreurs les plus coûteuses sont celles qui passent inaperçues. Le périmètre de détection est limité aux tâches piégées du corpus.
- Le coût réel d'usage n'est pas établi : une décision d'achat ne peut pas s'appuyer sur cette campagne.
- Un résultat obtenu une fois n'est pas garanti au rejeu : la stabilité fait partie de la décision, pas seulement la qualité.
Ces interprétations n'ont pas valeur de constat : elles décrivent ce que la source active laisse voir.
À vérifier en réel
- 1. Mesurer une baseline humaine réelle, chronométrée, sur une tâche
- 2. Exécuter réellement les trois modes A/B/C sur cette même tâche
- 3. Relever les coûts réels d'accès et d'usage
- 4. Tester la détection d'anomalie sur les tâches piégées
Hors de portée du rapport
- Aucun classement d'assistants réels : aucune sortie n'a été produite par un assistant interrogé, les 300 expériences sont générées de façon déterministe.
- Aucune baseline chronométrée par un humain : les temps de référence sont produits par le générateur, jamais mesurés sur une exécution réelle.
- Aucune généralisation de gain de temps à d'autres tâches, contextes ou organisations que le corpus T01→T20 simulé.
1. Inventaire et provenance
Ce que contient la source active, rapporté aux attendus du protocole.
| Élément | Réalisé | Attendu | Couverture |
|---|---|---|---|
| Expériences principales | 300 | 300 | couverture : 300 réalisées / 300 attendues |
| Rejeux | 60 | 60 | couverture : 60 réalisées / 60 attendues |
| Baselines humaines | 20 | 20 | couverture : 20 réalisées / 20 attendues |
| Doubles évaluations | 30 | 30 | couverture : 30 réalisées / 30 attendues |
| Verdicts établis | 20 | 20 | couverture : 20 réalisées / 20 attendues |
Contrôle de provenance : 360 enregistrements dans la source, 300 expériences principales et 60 rejeux lus, 20 tâches lues. Toutes les valeurs de ce rapport proviennent de la source active.
2. Lecture globale
Chaque moyenne porte sa propre couverture : une valeur calculée sur un sous-ensemble n'est jamais présentée comme portant sur les 300 expériences. Les échelles n'ont pas la même orientation : qualité et reproductibilité élevées sont favorables, supervision et risque élevés sont défavorables.
| Lecture | Valeur | Couverture |
|---|---|---|
| Qualité | 3.5 / 5 | couverture : 300 réalisées / 300 attendues calculée sur 300 expérience(s) sur 300 |
| Supervision | 2.7 / 5 | couverture : 300 réalisées / 300 attendues calculée sur 300 expérience(s) sur 300 |
| Reproductibilité | 3.5 / 5 | couverture : 300 réalisées / 300 attendues calculée sur 300 expérience(s) sur 300 |
| Risque | 2.5 / 5 | couverture : 300 réalisées / 300 attendues calculée sur 300 expérience(s) sur 300 |
| Temps humain total | 15.5 min | couverture : 300 réalisées / 300 attendues calculée sur 300 expérience(s) sur 300 |
| Temps de production assistant | 7.2 min | couverture : 300 réalisées / 300 attendues calculée sur 300 expérience(s) sur 300 |
| Gain opérationnel net | 5.1 min | couverture : 300 réalisées / 300 attendues calculée sur 300 expérience(s) sur 300 |
3. Lecture par tâche (T01→T20)
Une ligne par tâche du corpus, tous assistants et tous modes confondus.
| Tâche | Famille | Qualité | Temps humain | Baseline | Gain net | Supervision | Risque | Erreurs critiques | Verdict |
|---|---|---|---|---|---|---|---|---|---|
| T01Brief désordonné → synthèse | Analyse | 3.9 / 5 | 9.1 min | 14.1 min | 5 min | 1.5 / 5 | 1.4 / 5 | 0 | Assistable |
| T02Données commerciales → anomalies | Analyse | 3.8 / 5 | 10.6 min | 18.1 min | 7.5 min | 2.3 / 5 | 2 / 5 | 0 | Assistable |
| T03Comparer deux offres | Analyse | 3.7 / 5 | 12.8 min | 20.1 min | 7.3 min | 2.3 / 5 | 2.1 / 5 | 0 | Assistable |
| T04Contrat → points d'attention | Analyse | 3.3 / 5 | 16.2 min | 18.5 min | 2.3 min | 3.3 / 5 | 3.4 / 5 | 7 | À conserver humain |
| T05Réunion → actions | Production | 4.1 / 5 | 8.9 min | 15.2 min | 6.3 min | 1.8 / 5 | 1.3 / 5 | 0 | Automatisable |
| T06Brief → proposition commerciale | Production | 3.7 / 5 | 16.5 min | 25 min | 8.5 min | 2.4 / 5 | 2.2 / 5 | 1 | Assistable |
| T07Documentation → FAQ | Production | 4.1 / 5 | 11.4 min | 23.1 min | 11.7 min | 2 / 5 | 1.7 / 5 | 0 | Automatisable |
| T08Contenu → 3 formats | Production | 4 / 5 | 13 min | 23.3 min | 10.3 min | 2.1 / 5 | 1.6 / 5 | 0 | Assistable |
| T09Plan éditorial | Marketing | 3.6 / 5 | 15.1 min | 21 min | 5.9 min | 2.3 / 5 | 2 / 5 | 0 | Assistable |
| T10Expertise → LinkedIn | Marketing | 3.7 / 5 | 10.5 min | 15.5 min | 5 min | 1.9 / 5 | 2 / 5 | 0 | Assistable |
| T11Distribution multicanale | Marketing | 3.2 / 5 | 15 min | 19 min | 4 min | 2.4 / 5 | 1.9 / 5 | 2 | Accélérable |
| T12Cartographier processus | Processus | 3.6 / 5 | 16 min | 22.7 min | 6.7 min | 2.3 / 5 | 2.1 / 5 | 0 | Assistable |
| T13Processus → automatisation | Processus | 2.9 / 5 | 21.1 min | 23.6 min | 2.5 min | 3.5 / 5 | 3.4 / 5 | 12 | À conserver humain |
| T14Workflow humain + IA | Processus | 3.4 / 5 | 19.7 min | 23.5 min | 3.8 min | 3.5 / 5 | 3.6 / 5 | 9 | À conserver humain |
| T15Processus → procédure | Processus | 3.5 / 5 | 17.7 min | 24.9 min | 7.2 min | 2.8 / 5 | 2.6 / 5 | 4 | À conserver humain |
| T16Choisir un SaaS | Décision | 3.1 / 5 | 17 min | 19.6 min | 2.6 min | 3.3 / 5 | 2.7 / 5 | 10 | À conserver humain |
| T17ROI projet IA | Décision | 2.9 / 5 | 21 min | 22.8 min | 1.8 min | 3.6 / 5 | 3.5 / 5 | 15 | À conserver humain |
| T183 scénarios stratégiques | Décision | 3.2 / 5 | 19.1 min | 23.8 min | 4.7 min | 3.3 / 5 | 3 / 5 | 11 | À conserver humain |
| T19Contradictions métier | Limites | 3.2 / 5 | 20.3 min | 16.7 min | -3.6 min | 4 / 5 | 3.7 / 5 | 15 | À conserver humain |
| T20Que déléguer à l'IA ? | Limites | 3.3 / 5 | 18.2 min | 21 min | 2.8 min | 3.3 / 5 | 3 / 5 | 11 | À conserver humain |
4. Lecture par assistant
Aucun score global d'assistant n'est publié : la lecture reste ventilée par mode, avec sa couverture. Un assistant n'est pas comparable hors de la tâche et du mode où il a été observé.
| Assistant | Mode | Qualité | Temps humain | Supervision | Couverture |
|---|---|---|---|---|---|
| ChatGPTOpenAI — modèle non vérifié | Mode A | 2.9 / 5 | 15.7 min | 3.2 / 5 | couverture : 20 réalisées / 20 attendues |
| Mode B | 4 / 5 | 14.4 min | 2.2 / 5 | couverture : 20 réalisées / 20 attendues | |
| Mode C | 4.1 / 5 | 13.9 min | 2.3 / 5 | couverture : 20 réalisées / 20 attendues | |
| ClaudeAnthropic — modèle non vérifié | Mode A | 2.7 / 5 | 16.1 min | 3.2 / 5 | couverture : 20 réalisées / 20 attendues |
| Mode B | 4 / 5 | 14.5 min | 2.2 / 5 | couverture : 20 réalisées / 20 attendues | |
| Mode C | 4.2 / 5 | 14.1 min | 2.2 / 5 | couverture : 20 réalisées / 20 attendues | |
| GeminiGoogle — modèle non vérifié | Mode A | 2.8 / 5 | 15.8 min | 3.3 / 5 | couverture : 20 réalisées / 20 attendues |
| Mode B | 3.8 / 5 | 14.9 min | 2.5 / 5 | couverture : 20 réalisées / 20 attendues | |
| Mode C | 3.9 / 5 | 15.4 min | 2.6 / 5 | couverture : 20 réalisées / 20 attendues | |
| Microsoft CopilotMicrosoft — modèle non vérifié | Mode A | 2.7 / 5 | 16.8 min | 3.5 / 5 | couverture : 20 réalisées / 20 attendues |
| Mode B | 3.7 / 5 | 15.7 min | 2.6 / 5 | couverture : 20 réalisées / 20 attendues | |
| Mode C | 3.7 / 5 | 15.8 min | 2.6 / 5 | couverture : 20 réalisées / 20 attendues | |
| PerplexityPerplexity — modèle non vérifié | Mode A | 2.6 / 5 | 17.1 min | 3.5 / 5 | couverture : 20 réalisées / 20 attendues |
| Mode B | 3.7 / 5 | 15.9 min | 2.5 / 5 | couverture : 20 réalisées / 20 attendues | |
| Mode C | 4 / 5 | 15.7 min | 2.6 / 5 | couverture : 20 réalisées / 20 attendues |
Éléments critiques relevés
- ChatGPT : 19 erreur(s) critique(s), 12 constat(s) critique(s) — couverture 60/60.
- Claude : 19 erreur(s) critique(s), 11 constat(s) critique(s) — couverture 60/60.
- Gemini : 19 erreur(s) critique(s), 14 constat(s) critique(s) — couverture 60/60.
- Microsoft Copilot : 20 erreur(s) critique(s), 12 constat(s) critique(s) — couverture 60/60.
- Perplexity : 20 erreur(s) critique(s), 13 constat(s) critique(s) — couverture 60/60.
5. Lecture par mode A/B/C
Cœur du Lab : ce que change le contexte fourni, à tâche et assistant identiques.
| Mode | Qualité | Préparation | Production | Temps humain | Supervision | Reproductibilité | Risque | Gain net |
|---|---|---|---|---|---|---|---|---|
| Mode AUsage spontané | 2.7 / 5 | 1.3 min | 6.4 min | 16.3 min | 3.3 / 5 | 3.4 / 5 | 2.7 / 5 | 4.3 min |
| Mode BContexte structuré | 3.8 / 5 | 4.6 min | 6.7 min | 15.1 min | 2.4 / 5 | 3.6 / 5 | 2.5 / 5 | 5.5 min |
| Mode CInteraction | 4 / 5 | 4.9 min | 8.6 min | 15 min | 2.4 / 5 | 3.7 / 5 | 2.2 / 5 | 5.6 min |
6. Lecture par famille de tâches
Analyse — 4 tâche(s) : T01, T02, T03, T04
- Qualité moyenne3.7 / 5
- Temps humain total12.1 min
- Supervision2.4 / 5
- Risque2.2 / 5
Production — 4 tâche(s) : T05, T06, T07, T08
- Qualité moyenne4 / 5
- Temps humain total12.5 min
- Supervision2.1 / 5
- Risque1.7 / 5
Marketing — 3 tâche(s) : T09, T10, T11
- Qualité moyenne3.5 / 5
- Temps humain total13.5 min
- Supervision2.2 / 5
- Risque2 / 5
Processus — 4 tâche(s) : T12, T13, T14, T15
- Qualité moyenne3.4 / 5
- Temps humain total18.6 min
- Supervision3 / 5
- Risque2.9 / 5
Décision — 3 tâche(s) : T16, T17, T18
- Qualité moyenne3 / 5
- Temps humain total19 min
- Supervision3.4 / 5
- Risque3.1 / 5
Limites — 2 tâche(s) : T19, T20
- Qualité moyenne3.2 / 5
- Temps humain total19.3 min
- Supervision3.7 / 5
- Risque3.4 / 5
7. Temps et gains
Le temps humain additionne préparation, contrôle, correction et finalisation. Le temps de production de l'assistant est suivi séparément et n'entre pas dans le temps humain.
| Phase | Moyenne | Couverture |
|---|---|---|
| Préparation | 3.6 min | couverture : 300 réalisées / 300 attendues |
| Production assistant | 7.2 min | couverture : 300 réalisées / 300 attendues |
| Contrôle | 4.3 min | couverture : 300 réalisées / 300 attendues |
| Correction | 5.8 min | couverture : 300 réalisées / 300 attendues |
| Finalisation | 1.8 min | couverture : 300 réalisées / 300 attendues |
| Temps humain total | 15.5 min | couverture : 300 réalisées / 300 attendues |
Gains calculés uniquement sur les tâches dotées d'un temps de référence renseigné dans la source active (en campagne simulée, ce temps est généré, non chronométré) : 20 tâche(s), dont 19 à gain positif et 1 à gain négatif.
| Tâche | Temps de référence | Temps humain assisté | Gain net |
|---|---|---|---|
| T01Brief désordonné → synthèse | 14.1 min | 9.1 min | 5 min |
| T02Données commerciales → anomalies | 18.1 min | 10.6 min | 7.5 min |
| T03Comparer deux offres | 20.1 min | 12.8 min | 7.3 min |
| T04Contrat → points d'attention | 18.5 min | 16.2 min | 2.3 min |
| T05Réunion → actions | 15.2 min | 8.9 min | 6.3 min |
| T06Brief → proposition commerciale | 25 min | 16.5 min | 8.5 min |
| T07Documentation → FAQ | 23.1 min | 11.4 min | 11.7 min |
| T08Contenu → 3 formats | 23.3 min | 13 min | 10.3 min |
| T09Plan éditorial | 21 min | 15.1 min | 5.9 min |
| T10Expertise → LinkedIn | 15.5 min | 10.5 min | 5 min |
| T11Distribution multicanale | 19 min | 15 min | 4 min |
| T12Cartographier processus | 22.7 min | 16 min | 6.7 min |
| T13Processus → automatisation | 23.6 min | 21.1 min | 2.5 min |
| T14Workflow humain + IA | 23.5 min | 19.7 min | 3.8 min |
| T15Processus → procédure | 24.9 min | 17.7 min | 7.2 min |
| T16Choisir un SaaS | 19.6 min | 17 min | 2.6 min |
| T17ROI projet IA | 22.8 min | 21 min | 1.8 min |
| T183 scénarios stratégiques | 23.8 min | 19.1 min | 4.7 min |
| T19Contradictions métier | 16.7 min | 20.3 min | -3.6 min |
| T20Que déléguer à l'IA ? | 21 min | 18.2 min | 2.8 min |
8. Erreurs, risque et vérité de terrain
Aucune extrapolation : un champ non renseigné reste hors du total.
| Lecture | Valeur |
|---|---|
| Erreurs mineures | 554 |
| Erreurs majeures | 352 |
| Erreurs critiques | 97 |
| Expériences avec au moins une erreur critique | 62 |
| Constats critiques consignés | 62 |
| Anomalies détectées / manquées | 20 détectée(s) / 25 manquée(s) sur 45 expérience(s) applicable(s) (attendu 45, tâches T02, T15, T19) |
| Anomalie non applicable | 255 expérience(s) sans anomalie prévue par le corpus — jamais comptée(s) comme anomalie manquée. |
| Évaluation à l'aveugle | 300 déclarée(s) à l'aveugle, 0 non, 0 non renseignée(s) sur 300 |
| Points de vérité de terrain respectés | 795 / 1095 (72.6 %) |
| Complétude de collecte | 180 complète(s), 120 partielle(s) — champs manquants : cost.directCost, cost.accessCost |
Périmètre limité aux tâches à anomalie volontaire du corpus. Les expériences sans anomalie prévue sont « non applicable » et n'entrent ni dans les détections ni dans les manques.
`blindEvaluation = true` signifie que l'évaluation a été renseignée sans identification de l'assistant dans la grille. En campagne simulée, cette propriété est déclarée par le générateur pour toutes les expériences : elle ne prouve pas une anonymisation opérée par un évaluateur humain, et ne doit pas être lue comme une preuve d'objectivité.
Distribution du risque
- Risque 0 / 5 : 0 expérience(s)
- Risque 1 / 5 : 31 expérience(s)
- Risque 2 / 5 : 141 expérience(s)
- Risque 3 / 5 : 85 expérience(s)
- Risque 4 / 5 : 43 expérience(s)
- Risque 5 / 5 : 0 expérience(s)
9. Coûts
Un coût inconnu reste inconnu : aucun coût n'est reconstitué par division d'abonnement. Une expérience dont le coût d'accès ou le coût humain est inconnu n'a pas de coût total, quel que soit son statut déclaré.
| Lecture | Valeur | Couverture |
|---|---|---|
| Coût total réellement totalisable (3 composantes connues) | 180 | couverture : 180 réalisées / 300 attendues |
| Statuts déclarés : mesurable / non mesurable / non applicable | 180 / 120 / 0 | |
| Déclarées mesurables mais à composante manquante | 0 | |
| Coût direct moyen | 1.14 € | couverture : 180 réalisées / 300 attendues |
| Coût d'accès moyen | 0 € | couverture : 180 réalisées / 300 attendues |
| Coût humain opérationnel moyen | 14.98 € | couverture : 180 réalisées / 300 attendues |
| Coût total moyen par expérience | 16.12 € | couverture : 180 réalisées / 300 attendues |
| Coût cumulé connu | 2901.18 € | couverture : 180 réalisées / 300 attendues |
Le coût total moyen porte uniquement sur les expériences dont les trois composantes de coût sont connues.
10. Rejeux et stabilité
Les rejeux mesurent la stabilité. Ils ne remplacent jamais l'expérience d'origine et n'entrent pas dans les expériences principales.
| Lecture | Valeur |
|---|---|
| Rejeux exploitables | 60 — couverture 60/60 |
| Écart de qualité absolu moyen | 0.5 point(s) |
| Rejeux identiques à l'origine | 31 |
| Écart ≥ 1 point / ≥ 2 points | 29 / 1 |
| Rejeu | Origine | Tâche / mode / assistant | Δ qualité | Δ temps humain |
|---|---|---|---|---|
| L1-T01-A-CHATGPT-002 | L1-T01-A-CHATGPT-001 | T01 / A / ChatGPT | -1 | 1.3 min |
| L1-T01-B-CLAUDE-002 | L1-T01-B-CLAUDE-001 | T01 / B / Claude | -1 | 2.5 min |
| L1-T01-C-GEMINI-002 | L1-T01-C-GEMINI-001 | T01 / C / Gemini | 0 | 0.5 min |
| L1-T02-A-COPILOT-002 | L1-T02-A-COPILOT-001 | T02 / A / Microsoft Copilot | 1 | -2.3 min |
| L1-T02-B-PERPLEXITY-002 | L1-T02-B-PERPLEXITY-001 | T02 / B / Perplexity | 0 | 2.8 min |
| L1-T02-C-CHATGPT-002 | L1-T02-C-CHATGPT-001 | T02 / C / ChatGPT | 0 | 2.2 min |
| L1-T03-A-CLAUDE-002 | L1-T03-A-CLAUDE-001 | T03 / A / Claude | -1 | 3.8 min |
| L1-T03-B-GEMINI-002 | L1-T03-B-GEMINI-001 | T03 / B / Gemini | 0 | -0.7 min |
| L1-T03-C-COPILOT-002 | L1-T03-C-COPILOT-001 | T03 / C / Microsoft Copilot | -1 | -0.3 min |
| L1-T04-A-PERPLEXITY-002 | L1-T04-A-PERPLEXITY-001 | T04 / A / Perplexity | -1 | 3.8 min |
| L1-T04-B-CHATGPT-002 | L1-T04-B-CHATGPT-001 | T04 / B / ChatGPT | -1 | 0.7 min |
| L1-T04-C-CLAUDE-002 | L1-T04-C-CLAUDE-001 | T04 / C / Claude | 0 | -0.4 min |
| L1-T05-A-GEMINI-002 | L1-T05-A-GEMINI-001 | T05 / A / Gemini | -1 | 1.5 min |
| L1-T05-B-COPILOT-002 | L1-T05-B-COPILOT-001 | T05 / B / Microsoft Copilot | 0 | 2.3 min |
| L1-T05-C-PERPLEXITY-002 | L1-T05-C-PERPLEXITY-001 | T05 / C / Perplexity | 0 | -1.2 min |
| L1-T06-A-CHATGPT-002 | L1-T06-A-CHATGPT-001 | T06 / A / ChatGPT | 0 | -0.9 min |
| L1-T06-B-CLAUDE-002 | L1-T06-B-CLAUDE-001 | T06 / B / Claude | 0 | -1.6 min |
| L1-T06-C-GEMINI-002 | L1-T06-C-GEMINI-001 | T06 / C / Gemini | 0 | 0.2 min |
| L1-T07-A-COPILOT-002 | L1-T07-A-COPILOT-001 | T07 / A / Microsoft Copilot | 0 | -1.3 min |
| L1-T07-B-PERPLEXITY-002 | L1-T07-B-PERPLEXITY-001 | T07 / B / Perplexity | 0 | 1.3 min |
| L1-T07-C-CHATGPT-002 | L1-T07-C-CHATGPT-001 | T07 / C / ChatGPT | 0 | 0.6 min |
| L1-T08-A-CLAUDE-002 | L1-T08-A-CLAUDE-001 | T08 / A / Claude | -1 | 2.2 min |
| L1-T08-B-GEMINI-002 | L1-T08-B-GEMINI-001 | T08 / B / Gemini | 0 | 0.6 min |
| L1-T08-C-COPILOT-002 | L1-T08-C-COPILOT-001 | T08 / C / Microsoft Copilot | 0 | 0.9 min |
| L1-T09-A-PERPLEXITY-002 | L1-T09-A-PERPLEXITY-001 | T09 / A / Perplexity | -1 | 0.7 min |
| L1-T09-B-CHATGPT-002 | L1-T09-B-CHATGPT-001 | T09 / B / ChatGPT | -1 | 4.5 min |
| L1-T09-C-CLAUDE-002 | L1-T09-C-CLAUDE-001 | T09 / C / Claude | 1 | -1.6 min |
| L1-T10-A-GEMINI-002 | L1-T10-A-GEMINI-001 | T10 / A / Gemini | 1 | -1.7 min |
| L1-T10-B-COPILOT-002 | L1-T10-B-COPILOT-001 | T10 / B / Microsoft Copilot | -1 | 1.1 min |
| L1-T10-C-PERPLEXITY-002 | L1-T10-C-PERPLEXITY-001 | T10 / C / Perplexity | 1 | -3.1 min |
| L1-T11-A-CHATGPT-002 | L1-T11-A-CHATGPT-001 | T11 / A / ChatGPT | 0 | 1.1 min |
| L1-T11-B-CLAUDE-002 | L1-T11-B-CLAUDE-001 | T11 / B / Claude | -1 | 4.6 min |
| L1-T11-C-GEMINI-002 | L1-T11-C-GEMINI-001 | T11 / C / Gemini | 1 | -4.1 min |
| L1-T12-A-COPILOT-002 | L1-T12-A-COPILOT-001 | T12 / A / Microsoft Copilot | 0 | -2.6 min |
| L1-T12-B-PERPLEXITY-002 | L1-T12-B-PERPLEXITY-001 | T12 / B / Perplexity | 0 | -0.8 min |
| L1-T12-C-CHATGPT-002 | L1-T12-C-CHATGPT-001 | T12 / C / ChatGPT | 0 | 4 min |
| L1-T13-A-CLAUDE-002 | L1-T13-A-CLAUDE-001 | T13 / A / Claude | 0 | -0.5 min |
| L1-T13-B-GEMINI-002 | L1-T13-B-GEMINI-001 | T13 / B / Gemini | 0 | -1.2 min |
| L1-T13-C-COPILOT-002 | L1-T13-C-COPILOT-001 | T13 / C / Microsoft Copilot | 0 | 0.4 min |
| L1-T14-A-PERPLEXITY-002 | L1-T14-A-PERPLEXITY-001 | T14 / A / Perplexity | 0 | -2.2 min |
| L1-T14-B-CHATGPT-002 | L1-T14-B-CHATGPT-001 | T14 / B / ChatGPT | 0 | -0.7 min |
| L1-T14-C-CLAUDE-002 | L1-T14-C-CLAUDE-001 | T14 / C / Claude | 0 | 1.6 min |
| L1-T15-A-GEMINI-002 | L1-T15-A-GEMINI-001 | T15 / A / Gemini | 0 | 1.9 min |
| L1-T15-B-COPILOT-002 | L1-T15-B-COPILOT-001 | T15 / B / Microsoft Copilot | -1 | 6.2 min |
| L1-T15-C-PERPLEXITY-002 | L1-T15-C-PERPLEXITY-001 | T15 / C / Perplexity | -1 | 2.8 min |
| L1-T16-A-CHATGPT-002 | L1-T16-A-CHATGPT-001 | T16 / A / ChatGPT | 1 | -2.4 min |
| L1-T16-B-CLAUDE-002 | L1-T16-B-CLAUDE-001 | T16 / B / Claude | -1 | 2.4 min |
| L1-T16-C-GEMINI-002 | L1-T16-C-GEMINI-001 | T16 / C / Gemini | 0 | 0.3 min |
| L1-T17-A-COPILOT-002 | L1-T17-A-COPILOT-001 | T17 / A / Microsoft Copilot | 0 | 3.5 min |
| L1-T17-B-PERPLEXITY-002 | L1-T17-B-PERPLEXITY-001 | T17 / B / Perplexity | 1 | -0.9 min |
| L1-T17-C-CHATGPT-002 | L1-T17-C-CHATGPT-001 | T17 / C / ChatGPT | 0 | -1.6 min |
| L1-T18-A-CLAUDE-002 | L1-T18-A-CLAUDE-001 | T18 / A / Claude | 1 | -3.5 min |
| L1-T18-B-GEMINI-002 | L1-T18-B-GEMINI-001 | T18 / B / Gemini | -1 | 5.4 min |
| L1-T18-C-COPILOT-002 | L1-T18-C-COPILOT-001 | T18 / C / Microsoft Copilot | 1 | -3.6 min |
| L1-T19-A-PERPLEXITY-002 | L1-T19-A-PERPLEXITY-001 | T19 / A / Perplexity | 0 | 0.4 min |
| L1-T19-B-CHATGPT-002 | L1-T19-B-CHATGPT-001 | T19 / B / ChatGPT | 1 | -1.6 min |
| L1-T19-C-CLAUDE-002 | L1-T19-C-CLAUDE-001 | T19 / C / Claude | -2 | 7.8 min |
| L1-T20-A-GEMINI-002 | L1-T20-A-GEMINI-001 | T20 / A / Gemini | 1 | -1 min |
| L1-T20-B-COPILOT-002 | L1-T20-B-COPILOT-001 | T20 / B / Microsoft Copilot | 0 | -0.1 min |
| L1-T20-C-PERPLEXITY-002 | L1-T20-C-PERPLEXITY-001 | T20 / C / Perplexity | -1 | 3.3 min |
11. Doubles évaluations
Accord observé sur le sous-échantillon doublement évalué. Il ne constitue pas une preuve d'objectivité générale de l'évaluation.
| Lecture | Valeur |
|---|---|
| Sous-échantillon | 30 / 30 |
| Divergences significatives | 22 |
| Écart de qualité moyen | 0.8 point(s) |
| Accord de verdict | 56.7 % |
Accord observé sur le sous-échantillon doublement évalué. Ne constitue pas une preuve d'objectivité générale de l'évaluation.
12. Verdicts
Un verdict est multi-dimensionnel : il ne dérive jamais d'une seule métrique.
Répartition
- Automatisable : 2 tâche(s) — T05, T07
- Assistable : 8 tâche(s) — T01, T02, T03, T06, T08, T09, T10, T12
- Accélérable : 1 tâche(s) — T11
- Peu pertinent : 0 tâche(s)
- À conserver humain : 9 tâche(s) — T04, T13, T14, T15, T16, T17, T18, T19, T20
20 verdict(s) établi(s) sur 20 tâche(s).
| Tâche | Verdict | Justification | Expériences citées |
|---|---|---|---|
| T01Brief désordonné → synthèse | Assistable | Brief désordonné → synthèse — Extraire faits, décisions, contradictions et prochaines étapes d'un brief PME désordonné. Décidé par qualité 3,9/5 tenue, mais supervision 1,5/5 et risque 1,4/5 sur 15 expériences. Le mode C est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +5,0 min face à la référence humaine de 14,1 min. Contrainte de la fiche : Livrable attendu : Synthèse : faits ; décisions/non-décisions ; contradictions ; informations manquantes ; prochaines étapes. | 15 |
| T02Données commerciales → anomalies | Assistable | Données commerciales → anomalies — Analyser un tableau commercial et distinguer anomalie, tendance et donnée à vérifier. Décidé par qualité 3,8/5 tenue, mais supervision 2,3/5 et risque 2,0/5 sur 15 expériences. Le mode C est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +7,5 min face à la référence humaine de 18,1 min. Contrainte de la fiche : Livrable attendu : Taux utiles, anomalie de juin, interprétation prudente, demandes de vérification. | 15 |
| T03Comparer deux offres | Assistable | Comparer deux offres — Comparer deux offres SaaS et recommander sous contraintes. Décidé par qualité 3,7/5 tenue, mais supervision 2,3/5 et risque 2,1/5 sur 15 expériences. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +7,3 min face à la référence humaine de 20,1 min. Contrainte de la fiche : Livrable attendu : Grille, coûts 12 mois, avantages/limites, inconnues, recommandation conditionnelle. | 15 |
| T04Contrat → points d'attention | À conserver humain | Contrat → points d'attention — Identifier les clauses à vérifier sans donner d'avis juridique. Décidé par erreurs critiques sur 33 % des expériences et risque moyen 3,4/5 avec supervision 3,3/5. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +2,3 min face à la référence humaine de 18,5 min. Contrainte de la fiche : Aucune conclusion juridique ne doit être produite ni publiée à partir de cette tâche. | 15 |
| T05Réunion → actions | Automatisable | Réunion → actions — Transformer des notes en décisions, actions et sujets en attente. Décidé par qualité 4,1/5, supervision 1,8/5, reproductibilité 4,1/5 et risque 1,3/5. Le mode B est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +6,3 min face à la référence humaine de 15,2 min. Contrainte de la fiche : Livrable attendu : Compte rendu opérationnel sans inventer responsables ni échéances. | 15 |
| T06Brief → proposition commerciale | Assistable | Brief → proposition commerciale — Créer un premier jet de proposition commerciale. Décidé par qualité 3,7/5 tenue, mais supervision 2,4/5 et risque 2,2/5 sur 15 expériences. Le mode C est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +8,5 min face à la référence humaine de 25,0 min. Contrainte de la fiche : Livrable attendu : Contexte, objectif, périmètre, livrables, calendrier, prix, hypothèses, exclusions. | 15 |
| T07Documentation → FAQ | Automatisable | Documentation → FAQ — Créer une FAQ uniquement à partir d'une documentation. Décidé par qualité 4,1/5, supervision 2,0/5, reproductibilité 4,2/5 et risque 1,7/5. Le mode C est le plus favorable (qualité 4,6/5), le mode A le moins favorable. Gain net moyen +11,7 min face à la référence humaine de 23,1 min. Contrainte de la fiche : Livrable attendu : Réponses sourcées par le dossier ; inconnues explicitement signalées. | 15 |
| T08Contenu → 3 formats | Assistable | Contenu → 3 formats — Décliner fidèlement une idée en LinkedIn, newsletter et vidéo courte. Décidé par qualité 4,0/5 tenue, mais supervision 2,1/5 et risque 1,6/5 sur 15 expériences. Le mode C est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +10,3 min face à la référence humaine de 23,3 min. Contrainte de la fiche : Livrable attendu : Trois formats cohérents, sans statistiques ni exemples inventés. | 15 |
| T09Plan éditorial | Assistable | Plan éditorial — Construire 4 semaines soutenables pour une PME. Décidé par qualité 3,6/5 tenue, mais supervision 2,3/5 et risque 2,0/5 sur 15 expériences. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +5,9 min face à la référence humaine de 21,0 min. Contrainte de la fiche : Livrable attendu : Thèmes, intention, format, canal, CTA, réutilisation. | 15 |
| T10Expertise → LinkedIn | Assistable | Expertise → LinkedIn — Transformer une expertise brute en post crédible et sobre. Décidé par qualité 3,7/5 tenue, mais supervision 1,9/5 et risque 2,0/5 sur 15 expériences. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +5,0 min face à la référence humaine de 15,5 min. Contrainte de la fiche : Livrable attendu : Post de 1000 à 1400 caractères, fidèle, sans chiffres inventés. | 15 |
| T11Distribution multicanale | Accélérable | Distribution multicanale — Décliner une analyse en distribution cohérente avec 3 h par semaine. Décidé par qualité 3,2/5 et vérité de terrain 83 %. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +4,0 min face à la référence humaine de 19,0 min. Contrainte de la fiche : Livrable attendu : Sorties et ordre de production réalistes. | 15 |
| T12Cartographier processus | Assistable | Cartographier processus — Cartographier un traitement de demandes entrantes. Décidé par qualité 3,6/5 tenue, mais supervision 2,3/5 et risque 2,1/5 sur 15 expériences. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +6,7 min face à la référence humaine de 22,7 min. Contrainte de la fiche : Livrable attendu : Étapes, acteurs, décisions, exceptions, entrées/sorties, frictions ; pas de solution prématurée. | 15 |
| T13Processus → automatisation | À conserver humain | Processus → automatisation — Classer les étapes en automatisable, assistable, humain obligatoire ou à clarifier. Décidé par erreurs critiques sur 47 % des expériences et risque moyen 3,4/5 avec supervision 3,5/5. Le mode B est le plus favorable (qualité 3,4/5), le mode A le moins favorable. Gain net moyen +2,5 min face à la référence humaine de 23,6 min. Contrainte de la fiche : Livrable attendu : Classement + risque + contrôle recommandé. | 15 |
| T14Workflow humain + IA | À conserver humain | Workflow humain + IA — Concevoir un workflow sûr pour accélérer le tri et préparer les réponses. Décidé par erreurs critiques sur 33 % des expériences et risque moyen 3,6/5 avec supervision 3,5/5. Le mode B est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +3,8 min face à la référence humaine de 23,5 min. Contrainte de la fiche : Aucune réponse client ne doit être envoyée sans contrôle humain. | 15 |
| T15Processus → procédure | À conserver humain | Processus → procédure — Transformer une validation de facture en procédure pour débutant. Décidé par erreurs critiques sur 27 % des expériences et risque moyen 2,6/5 avec supervision 2,8/5. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +7,2 min face à la référence humaine de 24,9 min. Contrainte de la fiche : Livrable attendu : Procédure complète, règles, exceptions, contrôles. | 15 |
| T16Choisir un SaaS | À conserver humain | Choisir un SaaS — Décider entre trois outils sous contraintes. Décidé par erreurs critiques sur 33 % des expériences et risque moyen 2,7/5 avec supervision 3,3/5. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +2,6 min face à la référence humaine de 19,6 min. Contrainte de la fiche : Livrable attendu : Matrice, critère bloquant, incertitudes, recommandation conditionnelle. | 15 |
| T17ROI projet IA | À conserver humain | ROI projet IA — Évaluer un ROI sans inventer les variables manquantes. Décidé par erreurs critiques sur 67 % des expériences et risque moyen 3,5/5 avec supervision 3,6/5. Le mode C est le plus favorable (qualité 3,4/5), le mode A le moins favorable. Gain net moyen +1,8 min face à la référence humaine de 22,8 min. Contrainte de la fiche : Les hypothèses doivent rester distinguées des faits : aucun ROI ne doit être présenté comme mesuré. | 15 |
| T183 scénarios stratégiques | À conserver humain | 3 scénarios stratégiques — Comparer trois orientations avec données financières incomplètes. Décidé par erreurs critiques sur 47 % des expériences et risque moyen 3,0/5 avec supervision 3,3/5. Le mode B est le plus favorable (qualité 3,6/5), le mode A le moins favorable. Gain net moyen +4,7 min face à la référence humaine de 23,8 min. Contrainte de la fiche : Livrable attendu : Bénéfices, risques, prérequis, horizon, réversibilité, questions manquantes, recommandation conditionnelle. | 15 |
| T19Contradictions métier | À conserver humain | Contradictions métier — Traiter un problème ambigu sans inventer une politique. Décidé par erreurs critiques sur 67 % des expériences et risque moyen 3,7/5 avec supervision 4,0/5. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen −3,6 min face à la référence humaine de 16,7 min. Contrainte de la fiche : Aucune règle de priorisation ne doit être produite comme si elle avait été validée par l'entreprise. | 15 |
| T20Que déléguer à l'IA ? | À conserver humain | Que déléguer à l'IA ? — Classer 10 tâches PME par niveau de délégation et contrôle. Décidé par erreurs critiques sur 40 % des expériences et risque moyen 3,0/5 avec supervision 3,3/5. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +2,8 min face à la référence humaine de 21,0 min. Contrainte de la fiche : Les tâches irréversibles ou juridiques doivent être identifiées comme non délégables. | 15 |
13. Contre-intuitions et empreintes du générateur
Régularités trop nettes pour une exécution réelle. Elles sont conservées telles quelles : elles signalent que cette campagne est générée, pas exécutée.
| Empreinte | Observation |
|---|---|
| Erreurs critiques par mode | mode A : 82 · mode B : 11 · mode C : 4 |
| Signe des gains nets par tâche | 19 tâche(s) à gain positif, 1 à gain négatif sur 20 baseline(s) mesurée(s) : la distribution est trop homogène pour être généralisée. |
| Qualité des baselines | Valeur unique observée (4) : artefact du générateur, pas une mesure humaine variable. |
| Nombre de tours | Seulement 2 valeur(s) distincte(s) (1, 3) : variable quasi binaire, non réaliste. |
| Détection d'anomalie par mode | mode A : 0/15 · mode B : 9/15 · mode C : 11/15 — périmètre applicable 45/45 ; 255 expérience(s) non applicable(s), jamais comptée(s) comme manquée(s). |
| Coût non totalisable | Aucun coût total attribuable pour : Microsoft Copilot, Perplexity. Le statut déclaré ne suffit pas : les trois composantes doivent être connues. |
| Évaluation à l'aveugle | 300/300 expériences déclarées à l'aveugle par le générateur. Propriété déclarée, non vérifiée par un évaluateur humain. |
14. Lectures non soutenables
Ce que cette campagne ne permet pas d'affirmer, quelles que soient les valeurs affichées plus haut.
- • Aucun classement d'assistants réels : aucune sortie n'a été produite par un assistant interrogé, les 300 expériences sont générées de façon déterministe.
- • Aucune baseline chronométrée par un humain : les temps de référence sont produits par le générateur, jamais mesurés sur une exécution réelle.
- • Aucune généralisation de gain de temps à d'autres tâches, contextes ou organisations que le corpus T01→T20 simulé.
- • Aucune preuve d'objectivité de l'évaluation : l'aveugle est déclaré par le générateur et l'accord inter-évaluateurs porte sur un sous-échantillon simulé.
- • Aucune conclusion de coût réel : les coûts d'accès et d'usage ne sont pas relevés auprès des fournisseurs.
- • Aucune capacité réelle de détection d'anomalie : les anomalies ne sont évaluables que sur les tâches piégées du corpus, en environnement simulé.
15. Interprétations
Ce bloc n'est pas un résultat : c'est une lecture des chiffres ci-dessus. Il est séparé volontairement des mesures.
Interprétation — Effet du contexte
- • Les écarts entre les modes A, B et C se lisent à tâche et assistant identiques : le contexte fourni est la variable manipulée, pas l'assistant.
- • Un temps de préparation plus élevé n'est un gain que s'il réduit davantage le contrôle et la correction : c'est le temps humain total qui arbitre, pas une phase isolée.
Interprétation — Qualité, supervision et risque
- • Une qualité élevée assortie d'une supervision élevée ne décrit pas une tâche automatisable, mais une tâche assistable sous contrôle.
- • Le risque n'est pas la moyenne des erreurs : une seule erreur critique peut disqualifier un usage même quand la qualité moyenne est bonne.
Interprétation — Gains
- • Un gain net n'existe que là où une baseline humaine a été mesurée ; ailleurs, aucune économie de temps n'est affirmée.
- • Un gain négatif est un résultat, pas un échec de mesure : il signale une tâche où l'assistance déplace le travail au lieu de le réduire.
Interprétation — Stabilité et évaluation
- • Les rejeux qualifient la stabilité d'une observation, pas la qualité d'un assistant.
- • L'accord entre deux évaluations mesure la robustesse de la grille sur un sous-échantillon, pas l'objectivité de l'évaluation.
16. À vérifier en réel
Points qui ne peuvent être tranchés qu'avec le registre réel, aujourd'hui volontairement vide.
À vérifier en réel — Mesures
- • Temps réels par phase, chronométrés sur exécution effective, y compris les interruptions consignées séparément.
- • Baselines humaines réellement mesurées avant toute consultation des sorties d'assistants.
- • Coûts réels d'accès et d'usage, avec une méthode explicite et publiée.
À vérifier en réel — Comportement des assistants
- • Modèles et versions effectivement utilisés, environnement, navigation, outils et mémoire.
- • Détection réelle des anomalies sur les tâches piégées, sans indication implicite dans le prompt.
- • Stabilité temporelle sur des rejeux espacés, pas seulement sur des rejeux immédiats.
À vérifier en réel — Évaluation
- • Évaluation réellement à l'aveugle, avec traçabilité de l'anonymisation.
- • Accord inter-évaluateurs sur le sous-échantillon prévu par le protocole.
- • Verdicts établis par la règle multi-critères, contradictoires si les métriques s'opposent.
Aucune valeur de ce rapport n'est saisie manuellement : toutes proviennent de la source de données active du Lab. Le protocole, le corpus, la matrice d'exécution et le registre réel ne sont pas modifiés par ce rapport.

