Youpi Lab — expérimentation
Le travail réellement délégable à l'IA
20 tâches de PME × 5 assistants × 3 modes d'utilisation
La question
Qu'est-ce que l'IA peut réellement prendre en charge dans le travail quotidien d'une PME, dans quelles conditions, avec quel niveau de supervision et avec quelles limites ?
- Désigner « le meilleur assistant IA » : aucun score global d'assistant ne sera publié comme conclusion.
- Démontrer que l'IA est utile : nous cherchons à déterminer dans quelles conditions elle l'est.
- Évaluer des modèles sur des jeux de tests académiques : nous testons des tâches de travail réelles.
Protocole
Le protocole a été écrit et publié avant la collecte. Il est versionné : toute modification apparaît dans l'historique des versions.
Avancement de la collecte
0/300
Protocole publié. La collecte des 300 expériences n'a pas commencé : aucun résultat, aucun score, aucun verdict, aucun rejeu et aucune baseline ne sont publiés à ce stade.
Aucun résultat n'est publié avant réalisation effective des expériences. Aucune valeur n'est estimée ni extrapolée.
0/60
Rejeux réalisés. Un rejeu mesure la stabilité et ne compte jamais dans les 300 expériences principales.
0/20
Baselines humaines mesurées, une par tâche T01 à T20.
Ce que change le contexte
La lecture principale de cette expérimentation n'est pas « quel assistant gagne », mais ce que change la qualité du contexte fourni et de l'interaction.
Usage spontané
La tâche est demandée comme le ferait un professionnel pressé : une consigne réaliste et relativement minimale.
- Une seule demande initiale, sans matière préparée au-delà du strict nécessaire.
- Aucune relance de cadrage : la sortie évaluée est la première réponse utilisable.
- Le prompt exact est enregistré, ainsi que le nombre de tours (attendu : 1).
- Qualité moyenne
- non mesuré
- Temps de préparation
- non mesuré
- Temps humain total
- non mesuré
- Supervision
- non mesuré
couverture : 0 réalisée / 100 attendues — aucune donnée mesurée
Contexte structuré
Même tâche, mais toutes les informations pertinentes sont préparées et fournies dès la demande.
- Contexte, données, objectif, contraintes et format de livrable sont fournis en une fois.
- Le temps de préparation humaine est mesuré : il fait partie du coût de la méthode.
- Aucune information supplémentaire par rapport aux entrées déclarées de la tâche.
- Le nombre de tours attendu est 1 : toute relance rend l'expérience non conforme au mode.
- Qualité moyenne
- non mesuré
- Temps de préparation
- non mesuré
- Temps humain total
- non mesuré
- Supervision
- non mesuré
couverture : 0 réalisée / 100 attendues — aucune donnée mesurée
Interaction
L'assistant est explicitement autorisé à poser les questions nécessaires avant de produire le résultat.
- L'exigence est sémantique et non littérale : l'assistant doit indiquer explicitement quelles informations nécessaires manquent, sous n'importe quelle formulation claire. Aucune phrase imposée.
- Assistant mono-tour ou API : la réponse unique contient l'identification des manques puis le livrable. Aucune pénalité pour absence de tour supplémentaire.
- Assistant conversationnel : les questions sont enregistrées, l'expérimentateur répond une seule fois « aucune information supplémentaire disponible au-delà du dossier de test », et la sortie finale est celle qui est évaluée.
- Les réponses n'apportent aucune information hors du périmètre des entrées de la tâche : aucun avantage artificiel pour les systèmes conversationnels.
- Le temps consacré à l'échange est mesuré comme temps humain.
- Le nombre de tours est enregistré expérience par expérience : métrique descriptive, sans effet direct sur la note de qualité.
- Qualité moyenne
- non mesuré
- Temps de préparation
- non mesuré
- Temps humain total
- non mesuré
- Supervision
- non mesuré
couverture : 0 réalisée / 100 attendues — aucune donnée mesurée
Les 20 tâches
Des tâches réellement effectuées dans une PME, définies avec livrable attendu et critères de qualité, avant toute exécution.
- T01Analyse
Brief désordonné → synthèse
Extraire faits, décisions, contradictions et prochaines étapes d'un brief PME désordonné.
Verdict à établir - T02Analyse
Données commerciales → anomalies
Analyser un tableau commercial et distinguer anomalie, tendance et donnée à vérifier.
Verdict à établir - T03Analyse
Comparer deux offres
Comparer deux offres SaaS et recommander sous contraintes.
Verdict à établir - T04Analyse
Contrat → points d'attention
Identifier les clauses à vérifier sans donner d'avis juridique.
Verdict à établir - T05Production
Réunion → actions
Transformer des notes en décisions, actions et sujets en attente.
Verdict à établir - T06Production
Brief → proposition commerciale
Créer un premier jet de proposition commerciale.
Verdict à établir - T07Production
Documentation → FAQ
Créer une FAQ uniquement à partir d'une documentation.
Verdict à établir - T08Production
Contenu → 3 formats
Décliner fidèlement une idée en LinkedIn, newsletter et vidéo courte.
Verdict à établir - T09Marketing
Plan éditorial
Construire 4 semaines soutenables pour une PME.
Verdict à établir - T10Marketing
Expertise → LinkedIn
Transformer une expertise brute en post crédible et sobre.
Verdict à établir - T11Marketing
Distribution multicanale
Décliner une analyse en distribution cohérente avec 3 h par semaine.
Verdict à établir - T12Processus
Cartographier processus
Cartographier un traitement de demandes entrantes.
Verdict à établir - T13Processus
Processus → automatisation
Classer les étapes en automatisable, assistable, humain obligatoire ou à clarifier.
Verdict à établir - T14Processus
Workflow humain + IA
Concevoir un workflow sûr pour accélérer le tri et préparer les réponses.
Verdict à établir - T15Processus
Processus → procédure
Transformer une validation de facture en procédure pour débutant.
Verdict à établir - T16Décision
Choisir un SaaS
Décider entre trois outils sous contraintes.
Verdict à établir - T17Décision
ROI projet IA
Évaluer un ROI sans inventer les variables manquantes.
Verdict à établir - T18Décision
3 scénarios stratégiques
Comparer trois orientations avec données financières incomplètes.
Verdict à établir - T19Limites
Contradictions métier
Traiter un problème ambigu sans inventer une politique.
Verdict à établir - T20Limites
Que déléguer à l'IA ?
Classer 10 tâches PME par niveau de délégation et contrôle.
Verdict à établir
Les assistants testés
ChatGPT
OpenAI — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Claude
Anthropic — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Gemini
Google — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Microsoft Copilot
Microsoft — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Perplexity
Perplexity — offre à confirmer au moment du test
Modèle et version consignés au moment du test.
Référence humaine
La référence humaine est une expérience mesurée, tâche par tâche, et non une moyenne de marché. Sans référence mesurée, aucun gain n'est calculé.
Références mesurées : 0 / 20 tâches.
Aucune baseline n'est déclarée impossible à ce stade. Une baseline impossible resterait non mesurée et porterait sa justification : elle ne serait jamais estimée ni remplacée par celle d'une autre tâche.
Résultats mesurés
Données en cours de collecte
Aucun résultat n'est publié à ce stade. Le protocole, les 20 tâches et la matrice des 300 expériences sont publics ; les mesures paraîtront ici au fur et à mesure de la collecte, méthodologie et limites comprises.
Expériences réalisées : 0/300
300 cellules planifiées, 0 invalidées, 0 rejouées. Aucune valeur n'est estimée ni extrapolée.
Expériences — couverture : 0 réalisée / 300 attendues — aucune donnée mesurée
Verdicts par tâche
Un verdict n'est établi qu'après les trois modes et une baseline mesurée. Le verdict est une recommandation : ce n'est pas un niveau de preuve.
Verdicts établis : 0 / 20.
Coûts
- Coût direct, coût d'accès et coût humain sont enregistrés séparément.
- Aucun coût par tâche n'est déduit d'une division arbitraire du prix d'un abonnement.
- En édition 1, le coût humain opérationnel reste inconnu : aucun taux horaire n'est déclaré.
- Les temps restent mesurés et exploitables indépendamment de toute valorisation financière.
- Un coût publié est toujours accompagné de sa méthode de calcul.
Limites et reproductibilité
- Les modèles évoluent : les résultats sont datés et valent pour les versions enregistrées.
- Les baselines humaines sont des références expérimentales mesurées dans nos conditions, et non des moyennes de marché.
- 20 tâches ne couvrent pas l'ensemble du travail d'une PME : elles en couvrent des situations fréquentes.
- Les résultats dépendent de la qualité des données d'entrée que nous fournissons.
- Les mesures de temps portent une part d'imprécision inhérente à l'observation d'un travail réel.
- L'évaluation est réalisée par un nombre restreint d'évaluateurs, ce qui limite la portée statistique des notes.
- L'aveugle n'est pas toujours possible : lorsqu'il ne l'est pas, un biais de marque résiduel ne peut être exclu.
- Le protocole est versionné : toute modification produit une nouvelle version et est journalisée.
- Chaque expérience conserve la version du protocole et la version de la fiche tâche utilisées.
- La campagne comporte 300 expériences principales et jusqu'à 60 rejeux, soit environ 20 % des expériences principales.
- Les rejeux sont répartis de manière équilibrée entre tâches, modes et assistants, et sélectionnés après les premières expériences.
- Un rejeu est enregistré comme expérience distincte, liée à l'expérience d'origine (`replayOf`), avec la même tâche, le même mode, les mêmes données et une nouvelle session.
- Un rejeu ne compte jamais dans la couverture des 300 expériences principales : le champ `isReplay` est la seule source de vérité, indépendamment du statut de l'expérience.
- Un changement majeur de modèle ou de fonctionnalité déclenche une nouvelle version expérimentale, pas un simple rejeu.
- La méthodologie est publiée pour permettre à un tiers de reproduire l'expérimentation.
- Chaque expérience porte l'identifiant officiel `L1-T01-A-CHATGPT-001` : édition, tâche, mode, assistant, numéro de séquence.
- L'environnement d'exécution est enregistré : interface utilisée, navigation web, outils activés, dépôt de fichiers, mémoire, région éventuelle.
- Le modèle et la version réellement utilisés sont consignés au moment du test, jamais reconstitués après coup.
- Le nombre de tours est enregistré pour chaque expérience.
- Le prompt de référence de la tâche est cité (`prompt-A.md`, `prompt-B.md`, `prompt-C.md`) ; toute adaptation du prompt est signalée et justifiée.
- Les entrées synthétiques sont signalées comme telles et ne sont jamais présentées comme des données d'entreprises réelles.
- Chaque expérience porte un statut : planifiée, réalisée, invalidée ou rejouée. Une expérience invalidée porte sa raison et n'entre dans aucune agrégation.
- Les sorties brutes ne sont pas embarquées dans le site : chaque expérience porte une référence d'archive `lab-01/raw/<identifiant>/` contenant prompt, entrées, sortie et métadonnées.
- Les tâches disposent d'un dossier expérimental reproductible versionné dans le dépôt : `docs/lab/01/TXX/`.
Ce qui ne pourra jamais être conclu à partir de cette expérimentation
- Qu'un assistant est « meilleur » dans l'absolu.
- Que les résultats valent pour toutes les PME.
- Qu'une tâche est toujours automatisable.
- Que l'IA remplace un métier.
- Qu'un résultat obtenu aujourd'hui sera identique dans six mois.
- Qu'un gain observé sur une tâche s'applique à toutes les tâches.
Et maintenant ?
- Lisez le protocole avant les résultats : il indique ce que cette expérimentation pourra établir, et ce qu'elle ne pourra pas établir.
- Repérez dans les 20 fiches les tâches qui existent réellement chez vous : ce sont celles dont les mesures vous concerneront.
- Mesurez votre propre référence humaine sur une seule tâche : sans elle, aucun gain annoncé — ici ou ailleurs — n'est interprétable.
Youpi Lab, « Le travail réellement délégable à l'IA » — protocole version 1.3, Youpi News. Résultats non encore collectés.

