Youpi Lab — expérimentation
Le travail réellement délégable à l'IA
20 tâches de PME × 5 assistants × 3 modes d'utilisation
- 2.7 → 4
- Qualité moyenne sur 5, du mode A (sans contexte) au mode C
- 5.1 min
- Gain opérationnel net moyen face au temps de référence
- 9 / 20
- Tâches dont le verdict reste « à conserver humaine »
Valeurs issues de la campagne simulée, détaillées avec leur couverture ci-dessous.
Exporter ce rapport
Le fichier Markdown contient l'intégralité du rapport, avec ses couvertures et son statut de preuve. L'ouverture dans un assistant copie un prompt prêt à coller : il ne remplace pas le rapport complet, qui peut être joint via le fichier téléchargé. Le statut de campagne simulée est repris dans les deux exports.
Ce que le Lab a appris
Lecture en 5 minutes de la campagne simulée. Chaque enseignement porte sa couverture exacte et distingue l'observation de son interprétation. Rien ici n'atteste d'une exécution réelle.
Observation simulée
2.7 → 4
Qualité moyenne sur 5, du mode A au mode C
Qualité moyenne par mode : sans contexte 2.7 / 5, avec contexte 3.8 / 5, avec exigence sémantique 4 / 5.
Interprétation
Dans cette campagne simulée, ce qui distingue le plus les résultats est le contexte fourni, pas l'outil choisi. À vérifier en réel avant toute décision d'outillage.
couverture : 100 réalisées / 100 attendues
Observation simulée
2.7 / 5
Supervision moyenne requise (score élevé défavorable)
Supervision moyenne 2.7 / 5 (score élevé défavorable) pour une qualité moyenne de 3.5 / 5.
Interprétation
Un livrable assisté reste à contrôler : la simulation ne décrit aucun scénario sans reprise humaine.
couverture : 300 réalisées / 300 attendues
Observation simulée
5.1 min
Gain opérationnel net moyen par expérience
Temps humain total moyen 15.5 min et gain opérationnel net moyen 5.1 min ; 19 tâche(s) à gain positif et 1 à gain négatif sur 20 référence(s) disponible(s).
Interprétation
Le gain de temps simulé est réel mais borné, et il n'est pas homogène selon les tâches. Aucun de ces temps n'a été chronométré sur une exécution réelle.
couverture : 300 réalisées / 300 attendues
Verdicts établis 20 / 20 : 2 automatisable(s), 8 assistable(s), 9 à conserver humaine(s).
La délégation utile est sélective : la majorité des tâches du corpus relève de l'assistance ou du maintien humain, pas de l'automatisation.
couverture : 20 réalisées / 20 attendues
Risque moyen 2.5 / 5 (score élevé défavorable). Détection d'anomalie : 20 détectée(s), 25 manquée(s) sur 45 expérience(s) applicable(s) ; 255 expérience(s) sans anomalie prévue.
Les erreurs les plus coûteuses sont celles qui passent inaperçues. Le périmètre de détection est limité aux tâches piégées du corpus.
couverture : 45 réalisées / 45 attendues
Coût total calculable sur 180 expérience(s) / 300 ; 120 expérience(s) déclarée(s) non mesurable(s).
Le coût réel d'usage n'est pas établi : une décision d'achat ne peut pas s'appuyer sur cette campagne.
couverture : 180 réalisées / 300 attendues
Reproductibilité moyenne 3.5 / 5 (score élevé favorable).
Un résultat obtenu une fois n'est pas garanti au rejeu : la stabilité fait partie de la décision, pas seulement la qualité.
couverture : 300 réalisées / 300 attendues
Ce que nous en avons tiré
Les contenus publiés à partir de cette édition : ce qu'ils analysent, ce qu'ils recommandent, et la question qu'ils suivent dans le temps.
13 contenus publiés s'appuient directement sur cette édition du Lab. Chacun indique la lecture dont il dérive.
Analyses
- AnalyseT01 · T05 · T08 · T16
Ce qui fait varier la qualité d'une réponse d'IA : le cadrage, pas l'outil
Dans notre campagne, l'écart entre une demande brute et une demande cadrée atteint 1,2 point de qualité. L'écart entre les cinq assistants testés, à cadrage égal, n'en fait que 0,5.
Relation avec le Lab : Lecture directe des écarts de qualité par mode et par assistant du Lab #1.
- AnalyseT07 · T08 · T06 · T17 · T19
Le gain de temps de l'IA existe, mais il est petit et inégal
5,1 minutes de gain net moyen par expérience, 19 tâches gagnantes sur 20, et une tâche où l'assistance coûte 3,6 minutes de plus. La moyenne ne dit presque rien.
Relation avec le Lab : Lecture des temps et des gains nets, tâche par tâche, du Lab #1.
- AnalyseT05 · T16 · T17 · T18 · T19 · T20
Plus la tâche engage une décision, moins l'assistance est fiable
De la production de contenu à la décision stratégique, la qualité passe de 3,95 à 3,04 sur 5 et la supervision requise grimpe de 2,07 à 3,40. La pente est régulière.
Relation avec le Lab : Lecture croisée qualité / supervision / risque par famille de tâches du Lab #1.
- AnalyseT02 · T15 · T19 · T04
Les erreurs qui coûtent cher sont celles que personne ne voit
Sur les expériences où une anomalie avait été volontairement placée, 25 sur 45 sont passées inaperçues. Le sujet du contrôle n'est pas la qualité moyenne, c'est le trou.
Relation avec le Lab : Lecture des erreurs et de la détection d'anomalies des tâches piégées du Lab #1.
- AnalyseT03 · T09 · T13
Deux évaluateurs, deux verdicts : pourquoi juger une IA est difficile
Sur le sous-échantillon doublement évalué de notre campagne, deux évaluateurs à l'aveugle tombent d'accord sur le verdict dans 56,7 % des cas. La mesure est moins stable que le résultat qu'elle prétend établir.
Relation avec le Lab : Lecture des rejeux et de la double évaluation à l'aveugle du Lab #1.
Décisions
- DécisionT05 · T07 · T11 · T13 · T16 · T17 · T20
Que déléguer à l'IA dans une PME : la grille de tri en quatre niveaux
Sur les vingt tâches du corpus, deux sont classées automatisables, huit assistables, une accélérable et neuf à conserver humaines. Voici comment appliquer ce tri à vos propres tâches.
Relation avec le Lab : Traduction des 20 verdicts du corpus du Lab #1 en grille de tri.
- DécisionT03 · T16 · T18
Faut-il changer d'assistant IA ? Trois conditions avant d'engager un budget
À cadrage égal, l'écart entre les cinq assistants de la campagne est de 0,5 point. Et 93 % du coût calculable ne vient pas de l'abonnement, mais du temps humain.
Relation avec le Lab : Croisement de l'écart entre assistants et du périmètre de coût calculable du Lab #1.
- DécisionT12 · T13 · T14 · T15
Automatiser un processus : à quelles conditions, et à partir de quand
Dans notre campagne, documenter un processus avec l'IA fonctionne (3,60 / 5). L'automatiser échoue (2,87 / 5, douze erreurs critiques). L'écart dessine des conditions de passage.
Relation avec le Lab : Lecture des quatre tâches de processus (T12 à T15) du Lab #1.
- DécisionT01 · T06 · T09
Combien de minutes investir dans le cadrage avant de lancer une tâche
3,3 minutes de préparation en plus, 1,07 point de qualité en plus, et un temps humain total qui baisse. La préparation ne s'ajoute pas au travail : elle le déplace.
Relation avec le Lab : Lecture du coût en minutes du cadrage et de son effet sur qualité et supervision (Lab #1).
Dossiers vivants
- Dossier vivantT01 · T05 · T07 · T13 · T17 · T20
Que faut-il déléguer à l'IA, et que faut-il garder ?
Nous suivons cette question avec un protocole versionné et un corpus de vingt tâches professionnelles. L'état actuel repose sur une campagne simulée : le registre d'exécution réelle est encore vide, et nous le signalons à chaque mise à jour.
Relation avec le Lab : Dossier vivant de la question centrale du Lab #1.
- Dossier vivantT06 · T08 · T17
Le vrai coût de l'IA dans une PME
Ce que l'IA coûte réellement, une fois le temps humain compté. Nous suivons l'écart entre le prix affiché des outils et le coût d'usage constaté, et nous documentons ce qui n'est pas encore mesurable.
Relation avec le Lab : Dossier vivant adossé aux lectures de coût et de temps du Lab #1.
- Dossier vivantT04 · T14 · T19
Contrôle, risque et responsabilité
Qui répond de ce que produit l'IA dans l'entreprise ? Nous suivons les dispositifs de contrôle, les erreurs qui échappent à la relecture et les tâches qui doivent rester sous décision humaine.
Relation avec le Lab : Dossier vivant adossé aux lectures de risque, de contrôle et de verdicts du Lab #1.
La question
Qu'est-ce que l'IA peut réellement prendre en charge dans le travail quotidien d'une PME, dans quelles conditions, avec quel niveau de supervision et avec quelles limites ?
- Désigner « le meilleur assistant IA » : aucun score global d'assistant ne sera publié comme conclusion.
- Démontrer que l'IA est utile : nous cherchons à déterminer dans quelles conditions elle l'est.
- Évaluer des modèles sur des jeux de tests académiques : nous testons des tâches de travail réelles.
Protocole
Le protocole a été écrit et publié avant la collecte. Il est versionné : toute modification apparaît dans l'historique des versions.
Avancement de la collecte
300/300
Campagne simulée complète générée par un même moteur pour T01→T20 : 300 expériences principales, 60 rejeux, 20 baselines, 30 doubles évaluations. Ce ne sont pas des observations d'assistants réellement interrogés.
Aucun résultat n'est publié avant réalisation effective des expériences. Aucune valeur n'est estimée ni extrapolée.
60/60
Rejeux réalisés. Un rejeu mesure la stabilité et ne compte jamais dans les 300 expériences principales.
20/20
Baselines humaines mesurées, une par tâche T01 à T20.
30/30
Doubles évaluations du sous-échantillon prévu par le protocole.
Les assistants testés
ChatGPT
OpenAI — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Claude
Anthropic — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Gemini
Google — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Microsoft Copilot
Microsoft — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Perplexity
Perplexity — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Référence humaine
La référence humaine est une expérience mesurée, tâche par tâche, et non une moyenne de marché. Sans référence mesurée, aucun gain n'est calculé.
Références mesurées : 20 / 20 tâches.
Aucune baseline n'est déclarée impossible à ce stade. Une baseline impossible resterait non mesurée et porterait sa justification : elle ne serait jamais estimée ni remplacée par celle d'une autre tâche.
Résultats mesurés
| Métrique | Valeur | Couverture |
|---|---|---|
| Qualité | 3.5 / 5 | couverture : 300 réalisées / 300 attendues |
| Supervision requiseUne note élevée est défavorable | 2.7 / 5 | couverture : 300 réalisées / 300 attendues |
| RisqueUne note élevée est défavorable | 2.5 / 5 | couverture : 300 réalisées / 300 attendues |
| Reproductibilité | 3.5 / 5 | couverture : 300 réalisées / 300 attendues |
| Temps humain total | 15.5 min | couverture : 300 réalisées / 300 attendues |
| Temps de production | 7.2 min | couverture : 300 réalisées / 300 attendues |
| Gain netRéférence disponible moins temps humain total | 5.1 min | couverture : 300 réalisées / 300 attendues |
Ce que change le contexte
La lecture principale n'est pas « quel assistant gagne », mais ce que change la qualité du contexte fourni et de l'interaction.
Usage spontané
La tâche est demandée comme le ferait un professionnel pressé : une consigne réaliste et relativement minimale.
- Une seule demande initiale, sans matière préparée au-delà du strict nécessaire.
- Aucune relance de cadrage : la sortie évaluée est la première réponse utilisable.
- Le prompt exact est enregistré, ainsi que le nombre de tours (attendu : 1).
- Qualité moyenne
- 2.7
- Temps de préparation
- 1.3
- Temps humain total
- 16.3
- Supervision
- 3.3
couverture : 100 réalisées / 100 attendues
Contexte structuré
Même tâche, mais toutes les informations pertinentes sont préparées et fournies dès la demande.
- Contexte, données, objectif, contraintes et format de livrable sont fournis en une fois.
- Le temps de préparation humaine est mesuré : il fait partie du coût de la méthode.
- Aucune information supplémentaire par rapport aux entrées déclarées de la tâche.
- Le nombre de tours attendu est 1 : toute relance rend l'expérience non conforme au mode.
- Qualité moyenne
- 3.8
- Temps de préparation
- 4.6
- Temps humain total
- 15.1
- Supervision
- 2.4
couverture : 100 réalisées / 100 attendues
Interaction
L'assistant est explicitement autorisé à poser les questions nécessaires avant de produire le résultat.
- L'exigence est sémantique et non littérale : l'assistant doit indiquer explicitement quelles informations nécessaires manquent, sous n'importe quelle formulation claire. Aucune phrase imposée.
- Assistant mono-tour ou API : la réponse unique contient l'identification des manques puis le livrable. Aucune pénalité pour absence de tour supplémentaire.
- Assistant conversationnel : les questions sont enregistrées, l'expérimentateur répond une seule fois « aucune information supplémentaire disponible au-delà du dossier de test », et la sortie finale est celle qui est évaluée.
- Les réponses n'apportent aucune information hors du périmètre des entrées de la tâche : aucun avantage artificiel pour les systèmes conversationnels.
- Le temps consacré à l'échange est mesuré comme temps humain.
- Le nombre de tours est enregistré expérience par expérience : métrique descriptive, sans effet direct sur la note de qualité.
- Qualité moyenne
- 4
- Temps de préparation
- 4.9
- Temps humain total
- 15
- Supervision
- 2.4
couverture : 100 réalisées / 100 attendues
| Mode | Qualité | Supervision | Risque | Temps humain | Gain net | Couverture |
|---|---|---|---|---|---|---|
| Mode AUsage spontané | 2.7 / 5 | 3.3 / 5 | 2.7 / 5 | 16.3 min | 4.3 min | couverture : 100 réalisées / 100 attendues |
| Mode BContexte structuré | 3.8 / 5 | 2.4 / 5 | 2.5 / 5 | 15.1 min | 5.5 min | couverture : 100 réalisées / 100 attendues |
| Mode CInteraction | 4 / 5 | 2.4 / 5 | 2.2 / 5 | 15 min | 5.6 min | couverture : 100 réalisées / 100 attendues |
Lecture complète, assistant par assistant et tâche par tâche, dans le rapport analytique.
Les 20 tâches et leurs verdicts
Des tâches réellement effectuées dans une PME, définies avec livrable attendu et critères de qualité avant toute exécution. Un verdict n'est établi qu'après les trois modes et une référence disponible : c'est une recommandation, pas un niveau de preuve.
Verdicts établis : 20 / 20.
| Tâche | Famille | Qualité | Supervision | Risque | Gain net | Verdict | Couverture |
|---|---|---|---|---|---|---|---|
| T01Brief désordonné → synthèse | Analyse | 3.9 / 5 | 1.5 / 5 | 1.4 / 5 | 5 min | Assistable | couverture : 15 réalisées / 15 attendues |
| T02Données commerciales → anomalies | Analyse | 3.8 / 5 | 2.3 / 5 | 2 / 5 | 7.5 min | Assistable | couverture : 15 réalisées / 15 attendues |
| T03Comparer deux offres | Analyse | 3.7 / 5 | 2.3 / 5 | 2.1 / 5 | 7.3 min | Assistable | couverture : 15 réalisées / 15 attendues |
| T04Contrat → points d'attention | Analyse | 3.3 / 5 | 3.3 / 5 | 3.4 / 5 | 2.3 min | À conserver humain | couverture : 15 réalisées / 15 attendues |
| T05Réunion → actions | Production | 4.1 / 5 | 1.8 / 5 | 1.3 / 5 | 6.3 min | Automatisable | couverture : 15 réalisées / 15 attendues |
| T06Brief → proposition commerciale | Production | 3.7 / 5 | 2.4 / 5 | 2.2 / 5 | 8.5 min | Assistable | couverture : 15 réalisées / 15 attendues |
| T07Documentation → FAQ | Production | 4.1 / 5 | 2 / 5 | 1.7 / 5 | 11.7 min | Automatisable | couverture : 15 réalisées / 15 attendues |
| T08Contenu → 3 formats | Production | 4 / 5 | 2.1 / 5 | 1.6 / 5 | 10.3 min | Assistable | couverture : 15 réalisées / 15 attendues |
| T09Plan éditorial | Marketing | 3.6 / 5 | 2.3 / 5 | 2 / 5 | 5.9 min | Assistable | couverture : 15 réalisées / 15 attendues |
| T10Expertise → LinkedIn | Marketing | 3.7 / 5 | 1.9 / 5 | 2 / 5 | 5 min | Assistable | couverture : 15 réalisées / 15 attendues |
| T11Distribution multicanale | Marketing | 3.2 / 5 | 2.4 / 5 | 1.9 / 5 | 4 min | Accélérable | couverture : 15 réalisées / 15 attendues |
| T12Cartographier processus | Processus | 3.6 / 5 | 2.3 / 5 | 2.1 / 5 | 6.7 min | Assistable | couverture : 15 réalisées / 15 attendues |
| T13Processus → automatisation | Processus | 2.9 / 5 | 3.5 / 5 | 3.4 / 5 | 2.5 min | À conserver humain | couverture : 15 réalisées / 15 attendues |
| T14Workflow humain + IA | Processus | 3.4 / 5 | 3.5 / 5 | 3.6 / 5 | 3.8 min | À conserver humain | couverture : 15 réalisées / 15 attendues |
| T15Processus → procédure | Processus | 3.5 / 5 | 2.8 / 5 | 2.6 / 5 | 7.2 min | À conserver humain | couverture : 15 réalisées / 15 attendues |
| T16Choisir un SaaS | Décision | 3.1 / 5 | 3.3 / 5 | 2.7 / 5 | 2.6 min | À conserver humain | couverture : 15 réalisées / 15 attendues |
| T17ROI projet IA | Décision | 2.9 / 5 | 3.6 / 5 | 3.5 / 5 | 1.8 min | À conserver humain | couverture : 15 réalisées / 15 attendues |
| T183 scénarios stratégiques | Décision | 3.2 / 5 | 3.3 / 5 | 3 / 5 | 4.7 min | À conserver humain | couverture : 15 réalisées / 15 attendues |
| T19Contradictions métier | Limites | 3.2 / 5 | 4 / 5 | 3.7 / 5 | -3.6 min | À conserver humain | couverture : 15 réalisées / 15 attendues |
| T20Que déléguer à l'IA ? | Limites | 3.3 / 5 | 3.3 / 5 | 3 / 5 | 2.8 min | À conserver humain | couverture : 15 réalisées / 15 attendues |
Supervision et risque se lisent à l'envers de la qualité : une note élevée y est défavorable. Un verdict est une recommandation dérivée des mesures de la source active, pas un niveau de preuve. Cliquez sur une tâche pour ouvrir sa fiche complète.
Coûts
- Coût direct, coût d'accès et coût humain sont enregistrés séparément.
- Aucun coût par tâche n'est déduit d'une division arbitraire du prix d'un abonnement.
- Les temps restent mesurés et exploitables indépendamment de toute valorisation financière.
- Un coût publié est toujours accompagné de sa méthode de calcul.
- En campagne simulée, le coût humain opérationnel est valorisé par convention au taux de 60 €/h appliqué au temps humain généré : c'est une convention de lecture, pas un coût constaté chez un client.
180/300
Expériences dont le coût total est calculable : coût direct, coût d'accès et coût humain tous connus.
couverture : 180 réalisées / 300 attendues
120/300
Expériences déclarées non mesurables : leur coût total reste inconnu et n'est ni estimé, ni déduit d'une division d'abonnement.
Aucune décision d'achat ne peut s'appuyer sur cette lecture : le coût réel d'usage n'est pas établi.
Lexique des métriques
Toutes les métriques ne se lisent pas dans le même sens : une note élevée de qualité est favorable, une note élevée de supervision ou de risque ne l'est pas.
| Métrique | Définition | Sens de lecture |
|---|---|---|
| Qualité | 0 — livrable inutilisable · 5 — livrable directement exploitable | Un score élevé est favorable : plus la note est haute, plus le livrable est utilisable en l'état. |
| Supervision nécessaire | 0 — aucune intervention humaine nécessaire · 5 — intervention humaine très importante | Un score élevé est défavorable : plus la note est haute, plus le travail humain de contrôle et de reprise est important. |
| Reproductibilité | 0 — résultat très instable d'une exécution à l'autre · 5 — résultat très stable et reproductible | Un score élevé est favorable : plus la note est haute, plus le résultat est stable au rejeu. |
| Risque | 0 — risque négligeable en cas d'erreur non détectée · 5 — risque critique en cas d'erreur non détectée | Un score élevé est défavorable : plus la note est haute, plus la conséquence d'une erreur non détectée est grave. |
| Temps humain total | Somme des temps de préparation, de contrôle, de correction et de finalisation. Le temps de production de l'assistant est suivi séparément et n'y entre pas. | Un temps humain total inférieur au temps de référence est favorable. Si une seule phase manque, le total reste inconnu. |
| Gain opérationnel net | Temps de référence de la tâche moins temps humain total. Sans temps de référence disponible, le gain n'est pas calculé. | Un gain positif est favorable. Un gain négatif signifie que la tâche assistée a coûté plus de temps humain. |
| Coût totalisable | Une expérience n'a de coût total que si ses trois composantes sont connues : coût direct, coût d'accès et coût humain opérationnel. | Une composante inconnue rend le coût total inconnu : il n'est ni estimé, ni déduit d'une division d'abonnement. |
Limites et reproductibilité
- Les modèles évoluent : les résultats sont datés et valent pour les versions enregistrées.
- Les baselines humaines sont des références expérimentales mesurées dans nos conditions, et non des moyennes de marché.
- 20 tâches ne couvrent pas l'ensemble du travail d'une PME : elles en couvrent des situations fréquentes.
- Les résultats dépendent de la qualité des données d'entrée que nous fournissons.
- Les mesures de temps portent une part d'imprécision inhérente à l'observation d'un travail réel.
- L'évaluation est réalisée par un nombre restreint d'évaluateurs, ce qui limite la portée statistique des notes.
- L'aveugle n'est pas toujours possible : lorsqu'il ne l'est pas, un biais de marque résiduel ne peut être exclu.
- Le protocole est versionné : toute modification produit une nouvelle version et est journalisée.
- Chaque expérience conserve la version du protocole et la version de la fiche tâche utilisées.
- La campagne comporte 300 expériences principales et jusqu'à 60 rejeux, soit environ 20 % des expériences principales.
- Les rejeux sont répartis de manière équilibrée entre tâches, modes et assistants, et sélectionnés après les premières expériences.
- Un rejeu est enregistré comme expérience distincte, liée à l'expérience d'origine (`replayOf`), avec la même tâche, le même mode, les mêmes données et une nouvelle session.
- Un rejeu ne compte jamais dans la couverture des 300 expériences principales : le champ `isReplay` est la seule source de vérité, indépendamment du statut de l'expérience.
- Un changement majeur de modèle ou de fonctionnalité déclenche une nouvelle version expérimentale, pas un simple rejeu.
- La méthodologie est publiée pour permettre à un tiers de reproduire l'expérimentation.
- Chaque expérience porte l'identifiant officiel `L1-T01-A-CHATGPT-001` : édition, tâche, mode, assistant, numéro de séquence.
- L'environnement d'exécution est enregistré : interface utilisée, navigation web, outils activés, dépôt de fichiers, mémoire, région éventuelle.
- Le modèle et la version réellement utilisés sont consignés au moment du test, jamais reconstitués après coup.
- Le nombre de tours est enregistré pour chaque expérience.
- Le prompt de référence de la tâche est cité (`prompt-A.md`, `prompt-B.md`, `prompt-C.md`) ; toute adaptation du prompt est signalée et justifiée.
- Les entrées synthétiques sont signalées comme telles et ne sont jamais présentées comme des données d'entreprises réelles.
- Chaque expérience porte un statut : planifiée, réalisée, invalidée ou rejouée. Une expérience invalidée porte sa raison et n'entre dans aucune agrégation.
- Les sorties brutes ne sont pas embarquées dans le site : chaque expérience porte une référence d'archive `lab-01/raw/<identifiant>/` contenant prompt, entrées, sortie et métadonnées.
- Les tâches disposent d'un dossier expérimental reproductible versionné dans le dépôt : `docs/lab/01/TXX/`.
Ce qui ne pourra jamais être conclu à partir de cette expérimentation
- Qu'un assistant est « meilleur » dans l'absolu.
- Que les résultats valent pour toutes les PME.
- Qu'une tâche est toujours automatisable.
- Que l'IA remplace un métier.
- Qu'un résultat obtenu aujourd'hui sera identique dans six mois.
- Qu'un gain observé sur une tâche s'applique à toutes les tâches.
Campagne réelle : où en est-on ?
Protocole publié. La collecte des 300 expériences n'a pas commencé : aucun résultat, aucun score, aucun verdict, aucun rejeu et aucune baseline ne sont publiés à ce stade.
La source affichée sur cette page est la campagne simulée (300 / 300 expériences générées). Le registre réel, lui, reste vide et n'est pas alimenté par la simulation.
Déclencheur du jalon suivant, tel qu'écrit dans le protocole v1.3 : À partir de la première expérience réalisée, l'édition est gelée : protocole, corpus des 20 tâches, prompts A/B/C, jeux d'entrée, grilles d'évaluation et matrice des 300 cellules ne sont plus modifiés.
Aucune date de collecte n'est annoncée : le protocole n'en fixe aucune.
Et chez vous ?
Aucune des tâches ci-dessous n'a été testée en conditions réelles. Les verdicts indiquent seulement par où commencer votre propre mesure.
Commencez par une seule tâche
Verdict simulé « Assistable ». C'est la tâche où le gain dépend le plus de votre contexte, donc celle qui vaut d'être mesurée en premier chez vous.
- 1. Chronométrez votre propre référence humaine sur cette seule tâche. Sans elle, aucun gain annoncé — ici ou ailleurs — n'est interprétable.
- 2. Rejouez la même tâche dans les trois modes A, B et C : l'écart entre modes est la lecture principale de ce Lab.
- 3. Notez le temps de reprise, pas seulement le temps de production : c'est lui qui absorbe le gain.
Ensuite seulement : T06, T02, T03. Ne commencez pas par les tâches classées « à conserver humaine » (T04, T13, T14, T15) : la supervision et le risque y absorbent le gain.
Youpi Lab, « Le travail réellement délégable à l'IA » — protocole version 1.3, Youpi News. Campagne simulée complète générée par un même moteur pour T01→T20 : 300 expériences principales, 60 rejeux, 20 baselines, 30 doubles évaluations. Ce ne sont pas des observations d'assistants réellement interrogés.

