Le travail réellement délégable à l'IA

Rapport analytique — Lab #1

Lecture intégrale de la campagne active : 20 tâches, 5 assistants, 3 modes, protocole v1.3. Chaque valeur est calculée à partir de la source de données active — aucune valeur n'est saisie dans ce rapport, et une mesure absente reste affichée « non mesuré ». En campagne simulée, aucun assistant n'a été interrogé et aucune baseline n'a été chronométrée par un humain : les temps de référence, comme les sorties, sont produits par le générateur.

Exporter ce rapport

Le fichier Markdown contient l'intégralité du rapport, avec ses couvertures et son statut de preuve. L'ouverture dans un assistant copie un prompt prêt à coller : il ne remplace pas le rapport complet, qui peut être joint via le fichier téléchargé. Le statut de campagne simulée est repris dans les deux exports.

0. Synthèse exécutive

Lecture courte du rapport. La colonne de gauche ne contient que des observations de la source active, la colonne du milieu ce qu'elles signifieraient, la colonne de droite ce qu'une exécution réelle doit trancher.

Résultat simulé

  • Qualité moyenne par mode : sans contexte 2.7 / 5, avec contexte 3.8 / 5, avec exigence sémantique 4 / 5.Couverture : 100 / 100
  • Supervision moyenne 2.7 / 5 (score élevé défavorable) pour une qualité moyenne de 3.5 / 5.Couverture : 300 / 300
  • Temps humain total moyen 15.5 min et gain opérationnel net moyen 5.1 min ; 19 tâche(s) à gain positif et 1 à gain négatif sur 20 référence(s) disponible(s).Couverture : 300 / 300
  • Verdicts établis 20 / 20 : 2 automatisable(s), 8 assistable(s), 9 à conserver humaine(s).Couverture : 20 / 20
  • Risque moyen 2.5 / 5 (score élevé défavorable). Détection d'anomalie : 20 détectée(s), 25 manquée(s) sur 45 expérience(s) applicable(s) ; 255 expérience(s) sans anomalie prévue.Couverture : 45 / 45
  • Coût total calculable sur 180 expérience(s) / 300 ; 120 expérience(s) déclarée(s) non mesurable(s).Couverture : 180 / 300
  • Reproductibilité moyenne 3.5 / 5 (score élevé favorable).Couverture : 300 / 300

Interprétation

  • Dans cette campagne simulée, ce qui distingue le plus les résultats est le contexte fourni, pas l'outil choisi. À vérifier en réel avant toute décision d'outillage.
  • Un livrable assisté reste à contrôler : la simulation ne décrit aucun scénario sans reprise humaine.
  • Le gain de temps simulé est réel mais borné, et il n'est pas homogène selon les tâches. Aucun de ces temps n'a été chronométré sur une exécution réelle.
  • La délégation utile est sélective : la majorité des tâches du corpus relève de l'assistance ou du maintien humain, pas de l'automatisation.
  • Les erreurs les plus coûteuses sont celles qui passent inaperçues. Le périmètre de détection est limité aux tâches piégées du corpus.
  • Le coût réel d'usage n'est pas établi : une décision d'achat ne peut pas s'appuyer sur cette campagne.
  • Un résultat obtenu une fois n'est pas garanti au rejeu : la stabilité fait partie de la décision, pas seulement la qualité.

Ces interprétations n'ont pas valeur de constat : elles décrivent ce que la source active laisse voir.

À vérifier en réel

  1. 1. Mesurer une baseline humaine réelle, chronométrée, sur une tâche
  2. 2. Exécuter réellement les trois modes A/B/C sur cette même tâche
  3. 3. Relever les coûts réels d'accès et d'usage
  4. 4. Tester la détection d'anomalie sur les tâches piégées

Hors de portée du rapport

  • Aucun classement d'assistants réels : aucune sortie n'a été produite par un assistant interrogé, les 300 expériences sont générées de façon déterministe.
  • Aucune baseline chronométrée par un humain : les temps de référence sont produits par le générateur, jamais mesurés sur une exécution réelle.
  • Aucune généralisation de gain de temps à d'autres tâches, contextes ou organisations que le corpus T01→T20 simulé.

1. Inventaire et provenance

Ce que contient la source active, rapporté aux attendus du protocole.

ÉlémentRéaliséAttenduCouverture
Expériences principales300300

couverture : 300 réalisées / 300 attendues

Rejeux6060

couverture : 60 réalisées / 60 attendues

Baselines humaines2020

couverture : 20 réalisées / 20 attendues

Doubles évaluations3030

couverture : 30 réalisées / 30 attendues

Verdicts établis2020

couverture : 20 réalisées / 20 attendues

Contrôle de provenance : 360 enregistrements dans la source, 300 expériences principales et 60 rejeux lus, 20 tâches lues. Toutes les valeurs de ce rapport proviennent de la source active.

2. Lecture globale

Chaque moyenne porte sa propre couverture : une valeur calculée sur un sous-ensemble n'est jamais présentée comme portant sur les 300 expériences. Les échelles n'ont pas la même orientation : qualité et reproductibilité élevées sont favorables, supervision et risque élevés sont défavorables.

LectureValeurCouverture
Qualité3.5 / 5

couverture : 300 réalisées / 300 attendues

calculée sur 300 expérience(s) sur 300
Supervision2.7 / 5

couverture : 300 réalisées / 300 attendues

calculée sur 300 expérience(s) sur 300
Reproductibilité3.5 / 5

couverture : 300 réalisées / 300 attendues

calculée sur 300 expérience(s) sur 300
Risque2.5 / 5

couverture : 300 réalisées / 300 attendues

calculée sur 300 expérience(s) sur 300
Temps humain total15.5 min

couverture : 300 réalisées / 300 attendues

calculée sur 300 expérience(s) sur 300
Temps de production assistant7.2 min

couverture : 300 réalisées / 300 attendues

calculée sur 300 expérience(s) sur 300
Gain opérationnel net5.1 min

couverture : 300 réalisées / 300 attendues

calculée sur 300 expérience(s) sur 300

3. Lecture par tâche (T01→T20)

Une ligne par tâche du corpus, tous assistants et tous modes confondus.

TâcheFamilleQualitéTemps humainBaselineGain netSupervisionRisqueErreurs critiquesVerdict
T01Brief désordonné → synthèseAnalyse3.9 / 59.1 min14.1 min5 min1.5 / 51.4 / 50Assistable
T02Données commerciales → anomaliesAnalyse3.8 / 510.6 min18.1 min7.5 min2.3 / 52 / 50Assistable
T03Comparer deux offresAnalyse3.7 / 512.8 min20.1 min7.3 min2.3 / 52.1 / 50Assistable
T04Contrat → points d'attentionAnalyse3.3 / 516.2 min18.5 min2.3 min3.3 / 53.4 / 57À conserver humain
T05Réunion → actionsProduction4.1 / 58.9 min15.2 min6.3 min1.8 / 51.3 / 50Automatisable
T06Brief → proposition commercialeProduction3.7 / 516.5 min25 min8.5 min2.4 / 52.2 / 51Assistable
T07Documentation → FAQProduction4.1 / 511.4 min23.1 min11.7 min2 / 51.7 / 50Automatisable
T08Contenu → 3 formatsProduction4 / 513 min23.3 min10.3 min2.1 / 51.6 / 50Assistable
T09Plan éditorialMarketing3.6 / 515.1 min21 min5.9 min2.3 / 52 / 50Assistable
T10Expertise → LinkedInMarketing3.7 / 510.5 min15.5 min5 min1.9 / 52 / 50Assistable
T11Distribution multicanaleMarketing3.2 / 515 min19 min4 min2.4 / 51.9 / 52Accélérable
T12Cartographier processusProcessus3.6 / 516 min22.7 min6.7 min2.3 / 52.1 / 50Assistable
T13Processus → automatisationProcessus2.9 / 521.1 min23.6 min2.5 min3.5 / 53.4 / 512À conserver humain
T14Workflow humain + IAProcessus3.4 / 519.7 min23.5 min3.8 min3.5 / 53.6 / 59À conserver humain
T15Processus → procédureProcessus3.5 / 517.7 min24.9 min7.2 min2.8 / 52.6 / 54À conserver humain
T16Choisir un SaaSDécision3.1 / 517 min19.6 min2.6 min3.3 / 52.7 / 510À conserver humain
T17ROI projet IADécision2.9 / 521 min22.8 min1.8 min3.6 / 53.5 / 515À conserver humain
T183 scénarios stratégiquesDécision3.2 / 519.1 min23.8 min4.7 min3.3 / 53 / 511À conserver humain
T19Contradictions métierLimites3.2 / 520.3 min16.7 min-3.6 min4 / 53.7 / 515À conserver humain
T20Que déléguer à l'IA ?Limites3.3 / 518.2 min21 min2.8 min3.3 / 53 / 511À conserver humain

4. Lecture par assistant

Aucun score global d'assistant n'est publié : la lecture reste ventilée par mode, avec sa couverture. Un assistant n'est pas comparable hors de la tâche et du mode où il a été observé.

AssistantModeQualitéTemps humainSupervisionCouverture
ChatGPTOpenAImodèle non vérifiéMode A2.9 / 515.7 min3.2 / 5

couverture : 20 réalisées / 20 attendues

Mode B4 / 514.4 min2.2 / 5

couverture : 20 réalisées / 20 attendues

Mode C4.1 / 513.9 min2.3 / 5

couverture : 20 réalisées / 20 attendues

ClaudeAnthropicmodèle non vérifiéMode A2.7 / 516.1 min3.2 / 5

couverture : 20 réalisées / 20 attendues

Mode B4 / 514.5 min2.2 / 5

couverture : 20 réalisées / 20 attendues

Mode C4.2 / 514.1 min2.2 / 5

couverture : 20 réalisées / 20 attendues

GeminiGooglemodèle non vérifiéMode A2.8 / 515.8 min3.3 / 5

couverture : 20 réalisées / 20 attendues

Mode B3.8 / 514.9 min2.5 / 5

couverture : 20 réalisées / 20 attendues

Mode C3.9 / 515.4 min2.6 / 5

couverture : 20 réalisées / 20 attendues

Microsoft CopilotMicrosoftmodèle non vérifiéMode A2.7 / 516.8 min3.5 / 5

couverture : 20 réalisées / 20 attendues

Mode B3.7 / 515.7 min2.6 / 5

couverture : 20 réalisées / 20 attendues

Mode C3.7 / 515.8 min2.6 / 5

couverture : 20 réalisées / 20 attendues

PerplexityPerplexitymodèle non vérifiéMode A2.6 / 517.1 min3.5 / 5

couverture : 20 réalisées / 20 attendues

Mode B3.7 / 515.9 min2.5 / 5

couverture : 20 réalisées / 20 attendues

Mode C4 / 515.7 min2.6 / 5

couverture : 20 réalisées / 20 attendues

Éléments critiques relevés

  • ChatGPT : 19 erreur(s) critique(s), 12 constat(s) critique(s) — couverture 60/60.
  • Claude : 19 erreur(s) critique(s), 11 constat(s) critique(s) — couverture 60/60.
  • Gemini : 19 erreur(s) critique(s), 14 constat(s) critique(s) — couverture 60/60.
  • Microsoft Copilot : 20 erreur(s) critique(s), 12 constat(s) critique(s) — couverture 60/60.
  • Perplexity : 20 erreur(s) critique(s), 13 constat(s) critique(s) — couverture 60/60.

5. Lecture par mode A/B/C

Cœur du Lab : ce que change le contexte fourni, à tâche et assistant identiques.

ModeQualitéPréparationProductionTemps humainSupervisionReproductibilitéRisqueGain net
Mode AUsage spontané2.7 / 51.3 min6.4 min16.3 min3.3 / 53.4 / 52.7 / 54.3 min
Mode BContexte structuré3.8 / 54.6 min6.7 min15.1 min2.4 / 53.6 / 52.5 / 55.5 min
Mode CInteraction4 / 54.9 min8.6 min15 min2.4 / 53.7 / 52.2 / 55.6 min

6. Lecture par famille de tâches

Analyse 4 tâche(s) : T01, T02, T03, T04

  • Qualité moyenne3.7 / 5
  • Temps humain total12.1 min
  • Supervision2.4 / 5
  • Risque2.2 / 5

Production 4 tâche(s) : T05, T06, T07, T08

  • Qualité moyenne4 / 5
  • Temps humain total12.5 min
  • Supervision2.1 / 5
  • Risque1.7 / 5

Marketing 3 tâche(s) : T09, T10, T11

  • Qualité moyenne3.5 / 5
  • Temps humain total13.5 min
  • Supervision2.2 / 5
  • Risque2 / 5

Processus 4 tâche(s) : T12, T13, T14, T15

  • Qualité moyenne3.4 / 5
  • Temps humain total18.6 min
  • Supervision3 / 5
  • Risque2.9 / 5

Décision 3 tâche(s) : T16, T17, T18

  • Qualité moyenne3 / 5
  • Temps humain total19 min
  • Supervision3.4 / 5
  • Risque3.1 / 5

Limites 2 tâche(s) : T19, T20

  • Qualité moyenne3.2 / 5
  • Temps humain total19.3 min
  • Supervision3.7 / 5
  • Risque3.4 / 5

7. Temps et gains

Le temps humain additionne préparation, contrôle, correction et finalisation. Le temps de production de l'assistant est suivi séparément et n'entre pas dans le temps humain.

PhaseMoyenneCouverture
Préparation3.6 min

couverture : 300 réalisées / 300 attendues

Production assistant7.2 min

couverture : 300 réalisées / 300 attendues

Contrôle4.3 min

couverture : 300 réalisées / 300 attendues

Correction5.8 min

couverture : 300 réalisées / 300 attendues

Finalisation1.8 min

couverture : 300 réalisées / 300 attendues

Temps humain total15.5 min

couverture : 300 réalisées / 300 attendues

Gains calculés uniquement sur les tâches dotées d'un temps de référence renseigné dans la source active (en campagne simulée, ce temps est généré, non chronométré) : 20 tâche(s), dont 19 à gain positif et 1 à gain négatif.

TâcheTemps de référenceTemps humain assistéGain net
T01Brief désordonné → synthèse14.1 min9.1 min5 min
T02Données commerciales → anomalies18.1 min10.6 min7.5 min
T03Comparer deux offres20.1 min12.8 min7.3 min
T04Contrat → points d'attention18.5 min16.2 min2.3 min
T05Réunion → actions15.2 min8.9 min6.3 min
T06Brief → proposition commerciale25 min16.5 min8.5 min
T07Documentation → FAQ23.1 min11.4 min11.7 min
T08Contenu → 3 formats23.3 min13 min10.3 min
T09Plan éditorial21 min15.1 min5.9 min
T10Expertise → LinkedIn15.5 min10.5 min5 min
T11Distribution multicanale19 min15 min4 min
T12Cartographier processus22.7 min16 min6.7 min
T13Processus → automatisation23.6 min21.1 min2.5 min
T14Workflow humain + IA23.5 min19.7 min3.8 min
T15Processus → procédure24.9 min17.7 min7.2 min
T16Choisir un SaaS19.6 min17 min2.6 min
T17ROI projet IA22.8 min21 min1.8 min
T183 scénarios stratégiques23.8 min19.1 min4.7 min
T19Contradictions métier16.7 min20.3 min-3.6 min
T20Que déléguer à l'IA ?21 min18.2 min2.8 min

8. Erreurs, risque et vérité de terrain

Aucune extrapolation : un champ non renseigné reste hors du total.

LectureValeur
Erreurs mineures554
Erreurs majeures352
Erreurs critiques97
Expériences avec au moins une erreur critique62
Constats critiques consignés62
Anomalies détectées / manquées20 détectée(s) / 25 manquée(s) sur 45 expérience(s) applicable(s) (attendu 45, tâches T02, T15, T19)
Anomalie non applicable255 expérience(s) sans anomalie prévue par le corpus — jamais comptée(s) comme anomalie manquée.
Évaluation à l'aveugle300 déclarée(s) à l'aveugle, 0 non, 0 non renseignée(s) sur 300
Points de vérité de terrain respectés795 / 1095 (72.6 %)
Complétude de collecte180 complète(s), 120 partielle(s) — champs manquants : cost.directCost, cost.accessCost

Périmètre limité aux tâches à anomalie volontaire du corpus. Les expériences sans anomalie prévue sont « non applicable » et n'entrent ni dans les détections ni dans les manques.

`blindEvaluation = true` signifie que l'évaluation a été renseignée sans identification de l'assistant dans la grille. En campagne simulée, cette propriété est déclarée par le générateur pour toutes les expériences : elle ne prouve pas une anonymisation opérée par un évaluateur humain, et ne doit pas être lue comme une preuve d'objectivité.

Distribution du risque

  • Risque 0 / 5 : 0 expérience(s)
  • Risque 1 / 5 : 31 expérience(s)
  • Risque 2 / 5 : 141 expérience(s)
  • Risque 3 / 5 : 85 expérience(s)
  • Risque 4 / 5 : 43 expérience(s)
  • Risque 5 / 5 : 0 expérience(s)

9. Coûts

Un coût inconnu reste inconnu : aucun coût n'est reconstitué par division d'abonnement. Une expérience dont le coût d'accès ou le coût humain est inconnu n'a pas de coût total, quel que soit son statut déclaré.

LectureValeurCouverture
Coût total réellement totalisable (3 composantes connues)180

couverture : 180 réalisées / 300 attendues

Statuts déclarés : mesurable / non mesurable / non applicable180 / 120 / 0
Déclarées mesurables mais à composante manquante0
Coût direct moyen1.14

couverture : 180 réalisées / 300 attendues

Coût d'accès moyen0

couverture : 180 réalisées / 300 attendues

Coût humain opérationnel moyen14.98

couverture : 180 réalisées / 300 attendues

Coût total moyen par expérience16.12

couverture : 180 réalisées / 300 attendues

Coût cumulé connu2901.18

couverture : 180 réalisées / 300 attendues

Le coût total moyen porte uniquement sur les expériences dont les trois composantes de coût sont connues.

10. Rejeux et stabilité

Les rejeux mesurent la stabilité. Ils ne remplacent jamais l'expérience d'origine et n'entrent pas dans les expériences principales.

LectureValeur
Rejeux exploitables60 — couverture 60/60
Écart de qualité absolu moyen0.5 point(s)
Rejeux identiques à l'origine31
Écart ≥ 1 point / ≥ 2 points29 / 1
RejeuOrigineTâche / mode / assistantΔ qualitéΔ temps humain
L1-T01-A-CHATGPT-002L1-T01-A-CHATGPT-001T01 / A / ChatGPT-11.3 min
L1-T01-B-CLAUDE-002L1-T01-B-CLAUDE-001T01 / B / Claude-12.5 min
L1-T01-C-GEMINI-002L1-T01-C-GEMINI-001T01 / C / Gemini00.5 min
L1-T02-A-COPILOT-002L1-T02-A-COPILOT-001T02 / A / Microsoft Copilot1-2.3 min
L1-T02-B-PERPLEXITY-002L1-T02-B-PERPLEXITY-001T02 / B / Perplexity02.8 min
L1-T02-C-CHATGPT-002L1-T02-C-CHATGPT-001T02 / C / ChatGPT02.2 min
L1-T03-A-CLAUDE-002L1-T03-A-CLAUDE-001T03 / A / Claude-13.8 min
L1-T03-B-GEMINI-002L1-T03-B-GEMINI-001T03 / B / Gemini0-0.7 min
L1-T03-C-COPILOT-002L1-T03-C-COPILOT-001T03 / C / Microsoft Copilot-1-0.3 min
L1-T04-A-PERPLEXITY-002L1-T04-A-PERPLEXITY-001T04 / A / Perplexity-13.8 min
L1-T04-B-CHATGPT-002L1-T04-B-CHATGPT-001T04 / B / ChatGPT-10.7 min
L1-T04-C-CLAUDE-002L1-T04-C-CLAUDE-001T04 / C / Claude0-0.4 min
L1-T05-A-GEMINI-002L1-T05-A-GEMINI-001T05 / A / Gemini-11.5 min
L1-T05-B-COPILOT-002L1-T05-B-COPILOT-001T05 / B / Microsoft Copilot02.3 min
L1-T05-C-PERPLEXITY-002L1-T05-C-PERPLEXITY-001T05 / C / Perplexity0-1.2 min
L1-T06-A-CHATGPT-002L1-T06-A-CHATGPT-001T06 / A / ChatGPT0-0.9 min
L1-T06-B-CLAUDE-002L1-T06-B-CLAUDE-001T06 / B / Claude0-1.6 min
L1-T06-C-GEMINI-002L1-T06-C-GEMINI-001T06 / C / Gemini00.2 min
L1-T07-A-COPILOT-002L1-T07-A-COPILOT-001T07 / A / Microsoft Copilot0-1.3 min
L1-T07-B-PERPLEXITY-002L1-T07-B-PERPLEXITY-001T07 / B / Perplexity01.3 min
L1-T07-C-CHATGPT-002L1-T07-C-CHATGPT-001T07 / C / ChatGPT00.6 min
L1-T08-A-CLAUDE-002L1-T08-A-CLAUDE-001T08 / A / Claude-12.2 min
L1-T08-B-GEMINI-002L1-T08-B-GEMINI-001T08 / B / Gemini00.6 min
L1-T08-C-COPILOT-002L1-T08-C-COPILOT-001T08 / C / Microsoft Copilot00.9 min
L1-T09-A-PERPLEXITY-002L1-T09-A-PERPLEXITY-001T09 / A / Perplexity-10.7 min
L1-T09-B-CHATGPT-002L1-T09-B-CHATGPT-001T09 / B / ChatGPT-14.5 min
L1-T09-C-CLAUDE-002L1-T09-C-CLAUDE-001T09 / C / Claude1-1.6 min
L1-T10-A-GEMINI-002L1-T10-A-GEMINI-001T10 / A / Gemini1-1.7 min
L1-T10-B-COPILOT-002L1-T10-B-COPILOT-001T10 / B / Microsoft Copilot-11.1 min
L1-T10-C-PERPLEXITY-002L1-T10-C-PERPLEXITY-001T10 / C / Perplexity1-3.1 min
L1-T11-A-CHATGPT-002L1-T11-A-CHATGPT-001T11 / A / ChatGPT01.1 min
L1-T11-B-CLAUDE-002L1-T11-B-CLAUDE-001T11 / B / Claude-14.6 min
L1-T11-C-GEMINI-002L1-T11-C-GEMINI-001T11 / C / Gemini1-4.1 min
L1-T12-A-COPILOT-002L1-T12-A-COPILOT-001T12 / A / Microsoft Copilot0-2.6 min
L1-T12-B-PERPLEXITY-002L1-T12-B-PERPLEXITY-001T12 / B / Perplexity0-0.8 min
L1-T12-C-CHATGPT-002L1-T12-C-CHATGPT-001T12 / C / ChatGPT04 min
L1-T13-A-CLAUDE-002L1-T13-A-CLAUDE-001T13 / A / Claude0-0.5 min
L1-T13-B-GEMINI-002L1-T13-B-GEMINI-001T13 / B / Gemini0-1.2 min
L1-T13-C-COPILOT-002L1-T13-C-COPILOT-001T13 / C / Microsoft Copilot00.4 min
L1-T14-A-PERPLEXITY-002L1-T14-A-PERPLEXITY-001T14 / A / Perplexity0-2.2 min
L1-T14-B-CHATGPT-002L1-T14-B-CHATGPT-001T14 / B / ChatGPT0-0.7 min
L1-T14-C-CLAUDE-002L1-T14-C-CLAUDE-001T14 / C / Claude01.6 min
L1-T15-A-GEMINI-002L1-T15-A-GEMINI-001T15 / A / Gemini01.9 min
L1-T15-B-COPILOT-002L1-T15-B-COPILOT-001T15 / B / Microsoft Copilot-16.2 min
L1-T15-C-PERPLEXITY-002L1-T15-C-PERPLEXITY-001T15 / C / Perplexity-12.8 min
L1-T16-A-CHATGPT-002L1-T16-A-CHATGPT-001T16 / A / ChatGPT1-2.4 min
L1-T16-B-CLAUDE-002L1-T16-B-CLAUDE-001T16 / B / Claude-12.4 min
L1-T16-C-GEMINI-002L1-T16-C-GEMINI-001T16 / C / Gemini00.3 min
L1-T17-A-COPILOT-002L1-T17-A-COPILOT-001T17 / A / Microsoft Copilot03.5 min
L1-T17-B-PERPLEXITY-002L1-T17-B-PERPLEXITY-001T17 / B / Perplexity1-0.9 min
L1-T17-C-CHATGPT-002L1-T17-C-CHATGPT-001T17 / C / ChatGPT0-1.6 min
L1-T18-A-CLAUDE-002L1-T18-A-CLAUDE-001T18 / A / Claude1-3.5 min
L1-T18-B-GEMINI-002L1-T18-B-GEMINI-001T18 / B / Gemini-15.4 min
L1-T18-C-COPILOT-002L1-T18-C-COPILOT-001T18 / C / Microsoft Copilot1-3.6 min
L1-T19-A-PERPLEXITY-002L1-T19-A-PERPLEXITY-001T19 / A / Perplexity00.4 min
L1-T19-B-CHATGPT-002L1-T19-B-CHATGPT-001T19 / B / ChatGPT1-1.6 min
L1-T19-C-CLAUDE-002L1-T19-C-CLAUDE-001T19 / C / Claude-27.8 min
L1-T20-A-GEMINI-002L1-T20-A-GEMINI-001T20 / A / Gemini1-1 min
L1-T20-B-COPILOT-002L1-T20-B-COPILOT-001T20 / B / Microsoft Copilot0-0.1 min
L1-T20-C-PERPLEXITY-002L1-T20-C-PERPLEXITY-001T20 / C / Perplexity-13.3 min

11. Doubles évaluations

Accord observé sur le sous-échantillon doublement évalué. Il ne constitue pas une preuve d'objectivité générale de l'évaluation.

LectureValeur
Sous-échantillon30 / 30
Divergences significatives22
Écart de qualité moyen0.8 point(s)
Accord de verdict56.7 %

Accord observé sur le sous-échantillon doublement évalué. Ne constitue pas une preuve d'objectivité générale de l'évaluation.

12. Verdicts

Un verdict est multi-dimensionnel : il ne dérive jamais d'une seule métrique.

Répartition

  • Automatisable : 2 tâche(s) — T05, T07
  • Assistable : 8 tâche(s) — T01, T02, T03, T06, T08, T09, T10, T12
  • Accélérable : 1 tâche(s) — T11
  • Peu pertinent : 0 tâche(s)
  • À conserver humain : 9 tâche(s) — T04, T13, T14, T15, T16, T17, T18, T19, T20

20 verdict(s) établi(s) sur 20 tâche(s).

TâcheVerdictJustificationExpériences citées
T01Brief désordonné → synthèseAssistableBrief désordonné → synthèse — Extraire faits, décisions, contradictions et prochaines étapes d'un brief PME désordonné. Décidé par qualité 3,9/5 tenue, mais supervision 1,5/5 et risque 1,4/5 sur 15 expériences. Le mode C est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +5,0 min face à la référence humaine de 14,1 min. Contrainte de la fiche : Livrable attendu : Synthèse : faits ; décisions/non-décisions ; contradictions ; informations manquantes ; prochaines étapes.15
T02Données commerciales → anomaliesAssistableDonnées commerciales → anomalies — Analyser un tableau commercial et distinguer anomalie, tendance et donnée à vérifier. Décidé par qualité 3,8/5 tenue, mais supervision 2,3/5 et risque 2,0/5 sur 15 expériences. Le mode C est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +7,5 min face à la référence humaine de 18,1 min. Contrainte de la fiche : Livrable attendu : Taux utiles, anomalie de juin, interprétation prudente, demandes de vérification.15
T03Comparer deux offresAssistableComparer deux offres — Comparer deux offres SaaS et recommander sous contraintes. Décidé par qualité 3,7/5 tenue, mais supervision 2,3/5 et risque 2,1/5 sur 15 expériences. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +7,3 min face à la référence humaine de 20,1 min. Contrainte de la fiche : Livrable attendu : Grille, coûts 12 mois, avantages/limites, inconnues, recommandation conditionnelle.15
T04Contrat → points d'attentionÀ conserver humainContrat → points d'attention — Identifier les clauses à vérifier sans donner d'avis juridique. Décidé par erreurs critiques sur 33 % des expériences et risque moyen 3,4/5 avec supervision 3,3/5. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +2,3 min face à la référence humaine de 18,5 min. Contrainte de la fiche : Aucune conclusion juridique ne doit être produite ni publiée à partir de cette tâche.15
T05Réunion → actionsAutomatisableRéunion → actions — Transformer des notes en décisions, actions et sujets en attente. Décidé par qualité 4,1/5, supervision 1,8/5, reproductibilité 4,1/5 et risque 1,3/5. Le mode B est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +6,3 min face à la référence humaine de 15,2 min. Contrainte de la fiche : Livrable attendu : Compte rendu opérationnel sans inventer responsables ni échéances.15
T06Brief → proposition commercialeAssistableBrief → proposition commerciale — Créer un premier jet de proposition commerciale. Décidé par qualité 3,7/5 tenue, mais supervision 2,4/5 et risque 2,2/5 sur 15 expériences. Le mode C est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +8,5 min face à la référence humaine de 25,0 min. Contrainte de la fiche : Livrable attendu : Contexte, objectif, périmètre, livrables, calendrier, prix, hypothèses, exclusions.15
T07Documentation → FAQAutomatisableDocumentation → FAQ — Créer une FAQ uniquement à partir d'une documentation. Décidé par qualité 4,1/5, supervision 2,0/5, reproductibilité 4,2/5 et risque 1,7/5. Le mode C est le plus favorable (qualité 4,6/5), le mode A le moins favorable. Gain net moyen +11,7 min face à la référence humaine de 23,1 min. Contrainte de la fiche : Livrable attendu : Réponses sourcées par le dossier ; inconnues explicitement signalées.15
T08Contenu → 3 formatsAssistableContenu → 3 formats — Décliner fidèlement une idée en LinkedIn, newsletter et vidéo courte. Décidé par qualité 4,0/5 tenue, mais supervision 2,1/5 et risque 1,6/5 sur 15 expériences. Le mode C est le plus favorable (qualité 4,4/5), le mode A le moins favorable. Gain net moyen +10,3 min face à la référence humaine de 23,3 min. Contrainte de la fiche : Livrable attendu : Trois formats cohérents, sans statistiques ni exemples inventés.15
T09Plan éditorialAssistablePlan éditorial — Construire 4 semaines soutenables pour une PME. Décidé par qualité 3,6/5 tenue, mais supervision 2,3/5 et risque 2,0/5 sur 15 expériences. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +5,9 min face à la référence humaine de 21,0 min. Contrainte de la fiche : Livrable attendu : Thèmes, intention, format, canal, CTA, réutilisation.15
T10Expertise → LinkedInAssistableExpertise → LinkedIn — Transformer une expertise brute en post crédible et sobre. Décidé par qualité 3,7/5 tenue, mais supervision 1,9/5 et risque 2,0/5 sur 15 expériences. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +5,0 min face à la référence humaine de 15,5 min. Contrainte de la fiche : Livrable attendu : Post de 1000 à 1400 caractères, fidèle, sans chiffres inventés.15
T11Distribution multicanaleAccélérableDistribution multicanale — Décliner une analyse en distribution cohérente avec 3 h par semaine. Décidé par qualité 3,2/5 et vérité de terrain 83 %. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +4,0 min face à la référence humaine de 19,0 min. Contrainte de la fiche : Livrable attendu : Sorties et ordre de production réalistes.15
T12Cartographier processusAssistableCartographier processus — Cartographier un traitement de demandes entrantes. Décidé par qualité 3,6/5 tenue, mais supervision 2,3/5 et risque 2,1/5 sur 15 expériences. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +6,7 min face à la référence humaine de 22,7 min. Contrainte de la fiche : Livrable attendu : Étapes, acteurs, décisions, exceptions, entrées/sorties, frictions ; pas de solution prématurée.15
T13Processus → automatisationÀ conserver humainProcessus → automatisation — Classer les étapes en automatisable, assistable, humain obligatoire ou à clarifier. Décidé par erreurs critiques sur 47 % des expériences et risque moyen 3,4/5 avec supervision 3,5/5. Le mode B est le plus favorable (qualité 3,4/5), le mode A le moins favorable. Gain net moyen +2,5 min face à la référence humaine de 23,6 min. Contrainte de la fiche : Livrable attendu : Classement + risque + contrôle recommandé.15
T14Workflow humain + IAÀ conserver humainWorkflow humain + IA — Concevoir un workflow sûr pour accélérer le tri et préparer les réponses. Décidé par erreurs critiques sur 33 % des expériences et risque moyen 3,6/5 avec supervision 3,5/5. Le mode B est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +3,8 min face à la référence humaine de 23,5 min. Contrainte de la fiche : Aucune réponse client ne doit être envoyée sans contrôle humain.15
T15Processus → procédureÀ conserver humainProcessus → procédure — Transformer une validation de facture en procédure pour débutant. Décidé par erreurs critiques sur 27 % des expériences et risque moyen 2,6/5 avec supervision 2,8/5. Le mode B est le plus favorable (qualité 4,0/5), le mode A le moins favorable. Gain net moyen +7,2 min face à la référence humaine de 24,9 min. Contrainte de la fiche : Livrable attendu : Procédure complète, règles, exceptions, contrôles.15
T16Choisir un SaaSÀ conserver humainChoisir un SaaS — Décider entre trois outils sous contraintes. Décidé par erreurs critiques sur 33 % des expériences et risque moyen 2,7/5 avec supervision 3,3/5. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +2,6 min face à la référence humaine de 19,6 min. Contrainte de la fiche : Livrable attendu : Matrice, critère bloquant, incertitudes, recommandation conditionnelle.15
T17ROI projet IAÀ conserver humainROI projet IA — Évaluer un ROI sans inventer les variables manquantes. Décidé par erreurs critiques sur 67 % des expériences et risque moyen 3,5/5 avec supervision 3,6/5. Le mode C est le plus favorable (qualité 3,4/5), le mode A le moins favorable. Gain net moyen +1,8 min face à la référence humaine de 22,8 min. Contrainte de la fiche : Les hypothèses doivent rester distinguées des faits : aucun ROI ne doit être présenté comme mesuré.15
T183 scénarios stratégiquesÀ conserver humain3 scénarios stratégiques — Comparer trois orientations avec données financières incomplètes. Décidé par erreurs critiques sur 47 % des expériences et risque moyen 3,0/5 avec supervision 3,3/5. Le mode B est le plus favorable (qualité 3,6/5), le mode A le moins favorable. Gain net moyen +4,7 min face à la référence humaine de 23,8 min. Contrainte de la fiche : Livrable attendu : Bénéfices, risques, prérequis, horizon, réversibilité, questions manquantes, recommandation conditionnelle.15
T19Contradictions métierÀ conserver humainContradictions métier — Traiter un problème ambigu sans inventer une politique. Décidé par erreurs critiques sur 67 % des expériences et risque moyen 3,7/5 avec supervision 4,0/5. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen −3,6 min face à la référence humaine de 16,7 min. Contrainte de la fiche : Aucune règle de priorisation ne doit être produite comme si elle avait été validée par l'entreprise.15
T20Que déléguer à l'IA ?À conserver humainQue déléguer à l'IA ? — Classer 10 tâches PME par niveau de délégation et contrôle. Décidé par erreurs critiques sur 40 % des expériences et risque moyen 3,0/5 avec supervision 3,3/5. Le mode C est le plus favorable (qualité 3,8/5), le mode A le moins favorable. Gain net moyen +2,8 min face à la référence humaine de 21,0 min. Contrainte de la fiche : Les tâches irréversibles ou juridiques doivent être identifiées comme non délégables.15

13. Contre-intuitions et empreintes du générateur

Régularités trop nettes pour une exécution réelle. Elles sont conservées telles quelles : elles signalent que cette campagne est générée, pas exécutée.

EmpreinteObservation
Erreurs critiques par modemode A : 82 · mode B : 11 · mode C : 4
Signe des gains nets par tâche19 tâche(s) à gain positif, 1 à gain négatif sur 20 baseline(s) mesurée(s) : la distribution est trop homogène pour être généralisée.
Qualité des baselinesValeur unique observée (4) : artefact du générateur, pas une mesure humaine variable.
Nombre de toursSeulement 2 valeur(s) distincte(s) (1, 3) : variable quasi binaire, non réaliste.
Détection d'anomalie par modemode A : 0/15 · mode B : 9/15 · mode C : 11/15 — périmètre applicable 45/45 ; 255 expérience(s) non applicable(s), jamais comptée(s) comme manquée(s).
Coût non totalisableAucun coût total attribuable pour : Microsoft Copilot, Perplexity. Le statut déclaré ne suffit pas : les trois composantes doivent être connues.
Évaluation à l'aveugle300/300 expériences déclarées à l'aveugle par le générateur. Propriété déclarée, non vérifiée par un évaluateur humain.

14. Lectures non soutenables

Ce que cette campagne ne permet pas d'affirmer, quelles que soient les valeurs affichées plus haut.

  • Aucun classement d'assistants réels : aucune sortie n'a été produite par un assistant interrogé, les 300 expériences sont générées de façon déterministe.
  • Aucune baseline chronométrée par un humain : les temps de référence sont produits par le générateur, jamais mesurés sur une exécution réelle.
  • Aucune généralisation de gain de temps à d'autres tâches, contextes ou organisations que le corpus T01→T20 simulé.
  • Aucune preuve d'objectivité de l'évaluation : l'aveugle est déclaré par le générateur et l'accord inter-évaluateurs porte sur un sous-échantillon simulé.
  • Aucune conclusion de coût réel : les coûts d'accès et d'usage ne sont pas relevés auprès des fournisseurs.
  • Aucune capacité réelle de détection d'anomalie : les anomalies ne sont évaluables que sur les tâches piégées du corpus, en environnement simulé.

15. Interprétations

Ce bloc n'est pas un résultat : c'est une lecture des chiffres ci-dessus. Il est séparé volontairement des mesures.

InterprétationEffet du contexte

  • Les écarts entre les modes A, B et C se lisent à tâche et assistant identiques : le contexte fourni est la variable manipulée, pas l'assistant.
  • Un temps de préparation plus élevé n'est un gain que s'il réduit davantage le contrôle et la correction : c'est le temps humain total qui arbitre, pas une phase isolée.

InterprétationQualité, supervision et risque

  • Une qualité élevée assortie d'une supervision élevée ne décrit pas une tâche automatisable, mais une tâche assistable sous contrôle.
  • Le risque n'est pas la moyenne des erreurs : une seule erreur critique peut disqualifier un usage même quand la qualité moyenne est bonne.

InterprétationGains

  • Un gain net n'existe que là où une baseline humaine a été mesurée ; ailleurs, aucune économie de temps n'est affirmée.
  • Un gain négatif est un résultat, pas un échec de mesure : il signale une tâche où l'assistance déplace le travail au lieu de le réduire.

InterprétationStabilité et évaluation

  • Les rejeux qualifient la stabilité d'une observation, pas la qualité d'un assistant.
  • L'accord entre deux évaluations mesure la robustesse de la grille sur un sous-échantillon, pas l'objectivité de l'évaluation.

16. À vérifier en réel

Points qui ne peuvent être tranchés qu'avec le registre réel, aujourd'hui volontairement vide.

À vérifier en réelMesures

  • Temps réels par phase, chronométrés sur exécution effective, y compris les interruptions consignées séparément.
  • Baselines humaines réellement mesurées avant toute consultation des sorties d'assistants.
  • Coûts réels d'accès et d'usage, avec une méthode explicite et publiée.

À vérifier en réelComportement des assistants

  • Modèles et versions effectivement utilisés, environnement, navigation, outils et mémoire.
  • Détection réelle des anomalies sur les tâches piégées, sans indication implicite dans le prompt.
  • Stabilité temporelle sur des rejeux espacés, pas seulement sur des rejeux immédiats.

À vérifier en réelÉvaluation

  • Évaluation réellement à l'aveugle, avec traçabilité de l'anonymisation.
  • Accord inter-évaluateurs sur le sous-échantillon prévu par le protocole.
  • Verdicts établis par la règle multi-critères, contradictoires si les métriques s'opposent.

Aucune valeur de ce rapport n'est saisie manuellement : toutes proviennent de la source de données active du Lab. Le protocole, le corpus, la matrice d'exécution et le registre réel ne sont pas modifiés par ce rapport.