Youpi Lab — expérimentation

Le travail réellement délégable à l'IA

20 tâches de PME × 5 assistants × 3 modes d'utilisation

2.7 → 4
Qualité moyenne sur 5, du mode A (sans contexte) au mode C
5.1 min
Gain opérationnel net moyen face au temps de référence
9 / 20
Tâches dont le verdict reste « à conserver humaine »

Valeurs issues de la campagne simulée, détaillées avec leur couverture ci-dessous.

Protocole v1.320 tâches × 5 assistants × 3 modes = 300 expériencesRapport analytiqueMéthodologieSuivi de la collecte

Exporter ce rapport

Le fichier Markdown contient l'intégralité du rapport, avec ses couvertures et son statut de preuve. L'ouverture dans un assistant copie un prompt prêt à coller : il ne remplace pas le rapport complet, qui peut être joint via le fichier téléchargé. Le statut de campagne simulée est repris dans les deux exports.

Ce que le Lab a appris

Lecture en 5 minutes de la campagne simulée. Chaque enseignement porte sa couverture exacte et distingue l'observation de son interprétation. Rien ici n'atteste d'une exécution réelle.

  1. Observation simulée

    2.7 → 4

    Qualité moyenne sur 5, du mode A au mode C

    Qualité moyenne par mode : sans contexte 2.7 / 5, avec contexte 3.8 / 5, avec exigence sémantique 4 / 5.

    Interprétation

    Dans cette campagne simulée, ce qui distingue le plus les résultats est le contexte fourni, pas l'outil choisi. À vérifier en réel avant toute décision d'outillage.

    couverture : 100 réalisées / 100 attendues

  2. Observation simulée

    2.7 / 5

    Supervision moyenne requise (score élevé défavorable)

    Supervision moyenne 2.7 / 5 (score élevé défavorable) pour une qualité moyenne de 3.5 / 5.

    Interprétation

    Un livrable assisté reste à contrôler : la simulation ne décrit aucun scénario sans reprise humaine.

    couverture : 300 réalisées / 300 attendues

  3. Observation simulée

    5.1 min

    Gain opérationnel net moyen par expérience

    Temps humain total moyen 15.5 min et gain opérationnel net moyen 5.1 min ; 19 tâche(s) à gain positif et 1 à gain négatif sur 20 référence(s) disponible(s).

    Interprétation

    Le gain de temps simulé est réel mais borné, et il n'est pas homogène selon les tâches. Aucun de ces temps n'a été chronométré sur une exécution réelle.

    couverture : 300 réalisées / 300 attendues

  • Verdicts établis 20 / 20 : 2 automatisable(s), 8 assistable(s), 9 à conserver humaine(s).

    La délégation utile est sélective : la majorité des tâches du corpus relève de l'assistance ou du maintien humain, pas de l'automatisation.

    couverture : 20 réalisées / 20 attendues

  • Risque moyen 2.5 / 5 (score élevé défavorable). Détection d'anomalie : 20 détectée(s), 25 manquée(s) sur 45 expérience(s) applicable(s) ; 255 expérience(s) sans anomalie prévue.

    Les erreurs les plus coûteuses sont celles qui passent inaperçues. Le périmètre de détection est limité aux tâches piégées du corpus.

    couverture : 45 réalisées / 45 attendues

  • Coût total calculable sur 180 expérience(s) / 300 ; 120 expérience(s) déclarée(s) non mesurable(s).

    Le coût réel d'usage n'est pas établi : une décision d'achat ne peut pas s'appuyer sur cette campagne.

    couverture : 180 réalisées / 300 attendues

  • Reproductibilité moyenne 3.5 / 5 (score élevé favorable).

    Un résultat obtenu une fois n'est pas garanti au rejeu : la stabilité fait partie de la décision, pas seulement la qualité.

    couverture : 300 réalisées / 300 attendues

Ce que nous en avons tiré

Les contenus publiés à partir de cette édition : ce qu'ils analysent, ce qu'ils recommandent, et la question qu'ils suivent dans le temps.

13 contenus publiés s'appuient directement sur cette édition du Lab. Chacun indique la lecture dont il dérive.

Analyses

Décisions

Dossiers vivants

La question

Qu'est-ce que l'IA peut réellement prendre en charge dans le travail quotidien d'une PME, dans quelles conditions, avec quel niveau de supervision et avec quelles limites ?

  • Désigner « le meilleur assistant IA » : aucun score global d'assistant ne sera publié comme conclusion.
  • Démontrer que l'IA est utile : nous cherchons à déterminer dans quelles conditions elle l'est.
  • Évaluer des modèles sur des jeux de tests académiques : nous testons des tâches de travail réelles.

Protocole

Le protocole a été écrit et publié avant la collecte. Il est versionné : toute modification apparaît dans l'historique des versions.

Avancement de la collecte

300/300

Campagne simulée complète générée par un même moteur pour T01→T20 : 300 expériences principales, 60 rejeux, 20 baselines, 30 doubles évaluations. Ce ne sont pas des observations d'assistants réellement interrogés.

Aucun résultat n'est publié avant réalisation effective des expériences. Aucune valeur n'est estimée ni extrapolée.

60/60

Rejeux réalisés. Un rejeu mesure la stabilité et ne compte jamais dans les 300 expériences principales.

20/20

Baselines humaines mesurées, une par tâche T01 à T20.

30/30

Doubles évaluations du sous-échantillon prévu par le protocole.

Les assistants testés

  • ChatGPT

    OpenAIoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

  • Claude

    Anthropicoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

  • Gemini

    Googleoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

  • Microsoft Copilot

    Microsoftoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

  • Perplexity

    Perplexityoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

Référence humaine

La référence humaine est une expérience mesurée, tâche par tâche, et non une moyenne de marché. Sans référence mesurée, aucun gain n'est calculé.

Références mesurées : 20 / 20 tâches.

Aucune baseline n'est déclarée impossible à ce stade. Une baseline impossible resterait non mesurée et porterait sa justification : elle ne serait jamais estimée ni remplacée par celle d'une autre tâche.

Résultats mesurés

Lecture globale de la source active. Chaque ligne porte sa couverture exacte : aucune moyenne n'est étendue au-delà des expériences réellement disponibles.
MétriqueValeurCouverture
Qualité3.5 / 5

couverture : 300 réalisées / 300 attendues

Supervision requiseUne note élevée est défavorable2.7 / 5

couverture : 300 réalisées / 300 attendues

RisqueUne note élevée est défavorable2.5 / 5

couverture : 300 réalisées / 300 attendues

Reproductibilité3.5 / 5

couverture : 300 réalisées / 300 attendues

Temps humain total15.5 min

couverture : 300 réalisées / 300 attendues

Temps de production7.2 min

couverture : 300 réalisées / 300 attendues

Gain netRéférence disponible moins temps humain total5.1 min

couverture : 300 réalisées / 300 attendues

Ce que change le contexte

La lecture principale n'est pas « quel assistant gagne », mais ce que change la qualité du contexte fourni et de l'interaction.

Mode A

Usage spontané

La tâche est demandée comme le ferait un professionnel pressé : une consigne réaliste et relativement minimale.

  • Une seule demande initiale, sans matière préparée au-delà du strict nécessaire.
  • Aucune relance de cadrage : la sortie évaluée est la première réponse utilisable.
  • Le prompt exact est enregistré, ainsi que le nombre de tours (attendu : 1).
Qualité moyenne
2.7
Temps de préparation
1.3
Temps humain total
16.3
Supervision
3.3

couverture : 100 réalisées / 100 attendues

Mode B

Contexte structuré

Même tâche, mais toutes les informations pertinentes sont préparées et fournies dès la demande.

  • Contexte, données, objectif, contraintes et format de livrable sont fournis en une fois.
  • Le temps de préparation humaine est mesuré : il fait partie du coût de la méthode.
  • Aucune information supplémentaire par rapport aux entrées déclarées de la tâche.
  • Le nombre de tours attendu est 1 : toute relance rend l'expérience non conforme au mode.
Qualité moyenne
3.8
Temps de préparation
4.6
Temps humain total
15.1
Supervision
2.4

couverture : 100 réalisées / 100 attendues

Mode C

Interaction

L'assistant est explicitement autorisé à poser les questions nécessaires avant de produire le résultat.

  • L'exigence est sémantique et non littérale : l'assistant doit indiquer explicitement quelles informations nécessaires manquent, sous n'importe quelle formulation claire. Aucune phrase imposée.
  • Assistant mono-tour ou API : la réponse unique contient l'identification des manques puis le livrable. Aucune pénalité pour absence de tour supplémentaire.
  • Assistant conversationnel : les questions sont enregistrées, l'expérimentateur répond une seule fois « aucune information supplémentaire disponible au-delà du dossier de test », et la sortie finale est celle qui est évaluée.
  • Les réponses n'apportent aucune information hors du périmètre des entrées de la tâche : aucun avantage artificiel pour les systèmes conversationnels.
  • Le temps consacré à l'échange est mesuré comme temps humain.
  • Le nombre de tours est enregistré expérience par expérience : métrique descriptive, sans effet direct sur la note de qualité.
Qualité moyenne
4
Temps de préparation
4.9
Temps humain total
15
Supervision
2.4

couverture : 100 réalisées / 100 attendues

Comparaison des modes A / B / C — ce que change le contexte fourni.
ModeQualitéSupervisionRisqueTemps humainGain netCouverture
Mode AUsage spontané2.7 / 53.3 / 52.7 / 516.3 min4.3 min

couverture : 100 réalisées / 100 attendues

Mode BContexte structuré3.8 / 52.4 / 52.5 / 515.1 min5.5 min

couverture : 100 réalisées / 100 attendues

Mode CInteraction4 / 52.4 / 52.2 / 515 min5.6 min

couverture : 100 réalisées / 100 attendues

Lecture complète, assistant par assistant et tâche par tâche, dans le rapport analytique.

Les 20 tâches et leurs verdicts

Des tâches réellement effectuées dans une PME, définies avec livrable attendu et critères de qualité avant toute exécution. Un verdict n'est établi qu'après les trois modes et une référence disponible : c'est une recommandation, pas un niveau de preuve.

Verdicts établis : 20 / 20.

TâcheFamilleQualitéSupervisionRisqueGain netVerdictCouverture
T01Brief désordonné → synthèseAnalyse3.9 / 51.5 / 51.4 / 55 minAssistable

couverture : 15 réalisées / 15 attendues

T02Données commerciales → anomaliesAnalyse3.8 / 52.3 / 52 / 57.5 minAssistable

couverture : 15 réalisées / 15 attendues

T03Comparer deux offresAnalyse3.7 / 52.3 / 52.1 / 57.3 minAssistable

couverture : 15 réalisées / 15 attendues

T04Contrat → points d'attentionAnalyse3.3 / 53.3 / 53.4 / 52.3 minÀ conserver humain

couverture : 15 réalisées / 15 attendues

T05Réunion → actionsProduction4.1 / 51.8 / 51.3 / 56.3 minAutomatisable

couverture : 15 réalisées / 15 attendues

T06Brief → proposition commercialeProduction3.7 / 52.4 / 52.2 / 58.5 minAssistable

couverture : 15 réalisées / 15 attendues

T07Documentation → FAQProduction4.1 / 52 / 51.7 / 511.7 minAutomatisable

couverture : 15 réalisées / 15 attendues

T08Contenu → 3 formatsProduction4 / 52.1 / 51.6 / 510.3 minAssistable

couverture : 15 réalisées / 15 attendues

T09Plan éditorialMarketing3.6 / 52.3 / 52 / 55.9 minAssistable

couverture : 15 réalisées / 15 attendues

T10Expertise → LinkedInMarketing3.7 / 51.9 / 52 / 55 minAssistable

couverture : 15 réalisées / 15 attendues

T11Distribution multicanaleMarketing3.2 / 52.4 / 51.9 / 54 minAccélérable

couverture : 15 réalisées / 15 attendues

T12Cartographier processusProcessus3.6 / 52.3 / 52.1 / 56.7 minAssistable

couverture : 15 réalisées / 15 attendues

T13Processus → automatisationProcessus2.9 / 53.5 / 53.4 / 52.5 minÀ conserver humain

couverture : 15 réalisées / 15 attendues

T14Workflow humain + IAProcessus3.4 / 53.5 / 53.6 / 53.8 minÀ conserver humain

couverture : 15 réalisées / 15 attendues

T15Processus → procédureProcessus3.5 / 52.8 / 52.6 / 57.2 minÀ conserver humain

couverture : 15 réalisées / 15 attendues

T16Choisir un SaaSDécision3.1 / 53.3 / 52.7 / 52.6 minÀ conserver humain

couverture : 15 réalisées / 15 attendues

T17ROI projet IADécision2.9 / 53.6 / 53.5 / 51.8 minÀ conserver humain

couverture : 15 réalisées / 15 attendues

T183 scénarios stratégiquesDécision3.2 / 53.3 / 53 / 54.7 minÀ conserver humain

couverture : 15 réalisées / 15 attendues

T19Contradictions métierLimites3.2 / 54 / 53.7 / 5-3.6 minÀ conserver humain

couverture : 15 réalisées / 15 attendues

T20Que déléguer à l'IA ?Limites3.3 / 53.3 / 53 / 52.8 minÀ conserver humain

couverture : 15 réalisées / 15 attendues

Supervision et risque se lisent à l'envers de la qualité : une note élevée y est défavorable. Un verdict est une recommandation dérivée des mesures de la source active, pas un niveau de preuve. Cliquez sur une tâche pour ouvrir sa fiche complète.

Coûts

  • Coût direct, coût d'accès et coût humain sont enregistrés séparément.
  • Aucun coût par tâche n'est déduit d'une division arbitraire du prix d'un abonnement.
  • Les temps restent mesurés et exploitables indépendamment de toute valorisation financière.
  • Un coût publié est toujours accompagné de sa méthode de calcul.
  • En campagne simulée, le coût humain opérationnel est valorisé par convention au taux de 60 €/h appliqué au temps humain généré : c'est une convention de lecture, pas un coût constaté chez un client.

180/300

Expériences dont le coût total est calculable : coût direct, coût d'accès et coût humain tous connus.

couverture : 180 réalisées / 300 attendues

120/300

Expériences déclarées non mesurables : leur coût total reste inconnu et n'est ni estimé, ni déduit d'une division d'abonnement.

Aucune décision d'achat ne peut s'appuyer sur cette lecture : le coût réel d'usage n'est pas établi.

Lexique des métriques

Toutes les métriques ne se lisent pas dans le même sens : une note élevée de qualité est favorable, une note élevée de supervision ou de risque ne l'est pas.

MétriqueDéfinitionSens de lecture
Qualité0 — livrable inutilisable · 5 — livrable directement exploitableUn score élevé est favorable : plus la note est haute, plus le livrable est utilisable en l'état.
Supervision nécessaire0 — aucune intervention humaine nécessaire · 5 — intervention humaine très importanteUn score élevé est défavorable : plus la note est haute, plus le travail humain de contrôle et de reprise est important.
Reproductibilité0 — résultat très instable d'une exécution à l'autre · 5 — résultat très stable et reproductibleUn score élevé est favorable : plus la note est haute, plus le résultat est stable au rejeu.
Risque0 — risque négligeable en cas d'erreur non détectée · 5 — risque critique en cas d'erreur non détectéeUn score élevé est défavorable : plus la note est haute, plus la conséquence d'une erreur non détectée est grave.
Temps humain totalSomme des temps de préparation, de contrôle, de correction et de finalisation. Le temps de production de l'assistant est suivi séparément et n'y entre pas.Un temps humain total inférieur au temps de référence est favorable. Si une seule phase manque, le total reste inconnu.
Gain opérationnel netTemps de référence de la tâche moins temps humain total. Sans temps de référence disponible, le gain n'est pas calculé.Un gain positif est favorable. Un gain négatif signifie que la tâche assistée a coûté plus de temps humain.
Coût totalisableUne expérience n'a de coût total que si ses trois composantes sont connues : coût direct, coût d'accès et coût humain opérationnel.Une composante inconnue rend le coût total inconnu : il n'est ni estimé, ni déduit d'une division d'abonnement.

Limites et reproductibilité

  • Les modèles évoluent : les résultats sont datés et valent pour les versions enregistrées.
  • Les baselines humaines sont des références expérimentales mesurées dans nos conditions, et non des moyennes de marché.
  • 20 tâches ne couvrent pas l'ensemble du travail d'une PME : elles en couvrent des situations fréquentes.
  • Les résultats dépendent de la qualité des données d'entrée que nous fournissons.
  • Les mesures de temps portent une part d'imprécision inhérente à l'observation d'un travail réel.
  • L'évaluation est réalisée par un nombre restreint d'évaluateurs, ce qui limite la portée statistique des notes.
  • L'aveugle n'est pas toujours possible : lorsqu'il ne l'est pas, un biais de marque résiduel ne peut être exclu.
  • Le protocole est versionné : toute modification produit une nouvelle version et est journalisée.
  • Chaque expérience conserve la version du protocole et la version de la fiche tâche utilisées.
  • La campagne comporte 300 expériences principales et jusqu'à 60 rejeux, soit environ 20 % des expériences principales.
  • Les rejeux sont répartis de manière équilibrée entre tâches, modes et assistants, et sélectionnés après les premières expériences.
  • Un rejeu est enregistré comme expérience distincte, liée à l'expérience d'origine (`replayOf`), avec la même tâche, le même mode, les mêmes données et une nouvelle session.
  • Un rejeu ne compte jamais dans la couverture des 300 expériences principales : le champ `isReplay` est la seule source de vérité, indépendamment du statut de l'expérience.
  • Un changement majeur de modèle ou de fonctionnalité déclenche une nouvelle version expérimentale, pas un simple rejeu.
  • La méthodologie est publiée pour permettre à un tiers de reproduire l'expérimentation.
  • Chaque expérience porte l'identifiant officiel `L1-T01-A-CHATGPT-001` : édition, tâche, mode, assistant, numéro de séquence.
  • L'environnement d'exécution est enregistré : interface utilisée, navigation web, outils activés, dépôt de fichiers, mémoire, région éventuelle.
  • Le modèle et la version réellement utilisés sont consignés au moment du test, jamais reconstitués après coup.
  • Le nombre de tours est enregistré pour chaque expérience.
  • Le prompt de référence de la tâche est cité (`prompt-A.md`, `prompt-B.md`, `prompt-C.md`) ; toute adaptation du prompt est signalée et justifiée.
  • Les entrées synthétiques sont signalées comme telles et ne sont jamais présentées comme des données d'entreprises réelles.
  • Chaque expérience porte un statut : planifiée, réalisée, invalidée ou rejouée. Une expérience invalidée porte sa raison et n'entre dans aucune agrégation.
  • Les sorties brutes ne sont pas embarquées dans le site : chaque expérience porte une référence d'archive `lab-01/raw/<identifiant>/` contenant prompt, entrées, sortie et métadonnées.
  • Les tâches disposent d'un dossier expérimental reproductible versionné dans le dépôt : `docs/lab/01/TXX/`.

Ce qui ne pourra jamais être conclu à partir de cette expérimentation

  • Qu'un assistant est « meilleur » dans l'absolu.
  • Que les résultats valent pour toutes les PME.
  • Qu'une tâche est toujours automatisable.
  • Que l'IA remplace un métier.
  • Qu'un résultat obtenu aujourd'hui sera identique dans six mois.
  • Qu'un gain observé sur une tâche s'applique à toutes les tâches.

Campagne réelle : où en est-on ?

Protocole publié. La collecte des 300 expériences n'a pas commencé : aucun résultat, aucun score, aucun verdict, aucun rejeu et aucune baseline ne sont publiés à ce stade.

La source affichée sur cette page est la campagne simulée (300 / 300 expériences générées). Le registre réel, lui, reste vide et n'est pas alimenté par la simulation.

Déclencheur du jalon suivant, tel qu'écrit dans le protocole v1.3 : À partir de la première expérience réalisée, l'édition est gelée : protocole, corpus des 20 tâches, prompts A/B/C, jeux d'entrée, grilles d'évaluation et matrice des 300 cellules ne sont plus modifiés.

Aucune date de collecte n'est annoncée : le protocole n'en fixe aucune.

Et chez vous ?

Aucune des tâches ci-dessous n'a été testée en conditions réelles. Les verdicts indiquent seulement par où commencer votre propre mesure.

Commencez par une seule tâche

T08Contenu → 3 formats

Verdict simulé « Assistable ». C'est la tâche où le gain dépend le plus de votre contexte, donc celle qui vaut d'être mesurée en premier chez vous.

  1. 1. Chronométrez votre propre référence humaine sur cette seule tâche. Sans elle, aucun gain annoncé — ici ou ailleurs — n'est interprétable.
  2. 2. Rejouez la même tâche dans les trois modes A, B et C : l'écart entre modes est la lecture principale de ce Lab.
  3. 3. Notez le temps de reprise, pas seulement le temps de production : c'est lui qui absorbe le gain.

Ensuite seulement : T06, T02, T03. Ne commencez pas par les tâches classées « à conserver humaine » (T04, T13, T14, T15) : la supervision et le risque y absorbent le gain.

Youpi Lab, « Le travail réellement délégable à l'IA » — protocole version 1.3, Youpi News. Campagne simulée complète générée par un même moteur pour T01→T20 : 300 expériences principales, 60 rejeux, 20 baselines, 30 doubles évaluations. Ce ne sont pas des observations d'assistants réellement interrogés.