SignauxPremiers signaux à venir : nous ne publions rien sans preuve.

Youpi Lab — expérimentation

Le travail réellement délégable à l'IA

20 tâches de PME × 5 assistants × 3 modes d'utilisation

ExpérimentationProtocole version 1.3Protocole publié le 23 août 202620 tâches × 5 assistants × 3 modes = 300 expériencesMéthodologie complèteSuivi de la collecte

La question

Qu'est-ce que l'IA peut réellement prendre en charge dans le travail quotidien d'une PME, dans quelles conditions, avec quel niveau de supervision et avec quelles limites ?

  • Désigner « le meilleur assistant IA » : aucun score global d'assistant ne sera publié comme conclusion.
  • Démontrer que l'IA est utile : nous cherchons à déterminer dans quelles conditions elle l'est.
  • Évaluer des modèles sur des jeux de tests académiques : nous testons des tâches de travail réelles.

Protocole

Le protocole a été écrit et publié avant la collecte. Il est versionné : toute modification apparaît dans l'historique des versions.

Avancement de la collecte

0/300

Protocole publié. La collecte des 300 expériences n'a pas commencé : aucun résultat, aucun score, aucun verdict, aucun rejeu et aucune baseline ne sont publiés à ce stade.

Aucun résultat n'est publié avant réalisation effective des expériences. Aucune valeur n'est estimée ni extrapolée.

0/60

Rejeux réalisés. Un rejeu mesure la stabilité et ne compte jamais dans les 300 expériences principales.

0/20

Baselines humaines mesurées, une par tâche T01 à T20.

Ce que change le contexte

La lecture principale de cette expérimentation n'est pas « quel assistant gagne », mais ce que change la qualité du contexte fourni et de l'interaction.

Mode A

Usage spontané

La tâche est demandée comme le ferait un professionnel pressé : une consigne réaliste et relativement minimale.

  • Une seule demande initiale, sans matière préparée au-delà du strict nécessaire.
  • Aucune relance de cadrage : la sortie évaluée est la première réponse utilisable.
  • Le prompt exact est enregistré, ainsi que le nombre de tours (attendu : 1).
Qualité moyenne
non mesuré
Temps de préparation
non mesuré
Temps humain total
non mesuré
Supervision
non mesuré

couverture : 0 réalisée / 100 attendues — aucune donnée mesurée

Mode B

Contexte structuré

Même tâche, mais toutes les informations pertinentes sont préparées et fournies dès la demande.

  • Contexte, données, objectif, contraintes et format de livrable sont fournis en une fois.
  • Le temps de préparation humaine est mesuré : il fait partie du coût de la méthode.
  • Aucune information supplémentaire par rapport aux entrées déclarées de la tâche.
  • Le nombre de tours attendu est 1 : toute relance rend l'expérience non conforme au mode.
Qualité moyenne
non mesuré
Temps de préparation
non mesuré
Temps humain total
non mesuré
Supervision
non mesuré

couverture : 0 réalisée / 100 attendues — aucune donnée mesurée

Mode C

Interaction

L'assistant est explicitement autorisé à poser les questions nécessaires avant de produire le résultat.

  • L'exigence est sémantique et non littérale : l'assistant doit indiquer explicitement quelles informations nécessaires manquent, sous n'importe quelle formulation claire. Aucune phrase imposée.
  • Assistant mono-tour ou API : la réponse unique contient l'identification des manques puis le livrable. Aucune pénalité pour absence de tour supplémentaire.
  • Assistant conversationnel : les questions sont enregistrées, l'expérimentateur répond une seule fois « aucune information supplémentaire disponible au-delà du dossier de test », et la sortie finale est celle qui est évaluée.
  • Les réponses n'apportent aucune information hors du périmètre des entrées de la tâche : aucun avantage artificiel pour les systèmes conversationnels.
  • Le temps consacré à l'échange est mesuré comme temps humain.
  • Le nombre de tours est enregistré expérience par expérience : métrique descriptive, sans effet direct sur la note de qualité.
Qualité moyenne
non mesuré
Temps de préparation
non mesuré
Temps humain total
non mesuré
Supervision
non mesuré

couverture : 0 réalisée / 100 attendues — aucune donnée mesurée

Les 20 tâches

Des tâches réellement effectuées dans une PME, définies avec livrable attendu et critères de qualité, avant toute exécution.

Les assistants testés

  • ChatGPT

    OpenAIoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

  • Claude

    Anthropicoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

  • Gemini

    Googleoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

  • Microsoft Copilot

    Microsoftoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

  • Perplexity

    Perplexityoffre à confirmer au moment du test

    Modèle et version consignés au moment du test.

Référence humaine

La référence humaine est une expérience mesurée, tâche par tâche, et non une moyenne de marché. Sans référence mesurée, aucun gain n'est calculé.

Références mesurées : 0 / 20 tâches.

Aucune baseline n'est déclarée impossible à ce stade. Une baseline impossible resterait non mesurée et porterait sa justification : elle ne serait jamais estimée ni remplacée par celle d'une autre tâche.

Résultats mesurés

Données en cours de collecte

Aucun résultat n'est publié à ce stade. Le protocole, les 20 tâches et la matrice des 300 expériences sont publics ; les mesures paraîtront ici au fur et à mesure de la collecte, méthodologie et limites comprises.

Expériences réalisées : 0/300

300 cellules planifiées, 0 invalidées, 0 rejouées. Aucune valeur n'est estimée ni extrapolée.

Expériences — couverture : 0 réalisée / 300 attendues — aucune donnée mesurée

Verdicts par tâche

Un verdict n'est établi qu'après les trois modes et une baseline mesurée. Le verdict est une recommandation : ce n'est pas un niveau de preuve.

Verdicts établis : 0 / 20.

Coûts

  • Coût direct, coût d'accès et coût humain sont enregistrés séparément.
  • Aucun coût par tâche n'est déduit d'une division arbitraire du prix d'un abonnement.
  • En édition 1, le coût humain opérationnel reste inconnu : aucun taux horaire n'est déclaré.
  • Les temps restent mesurés et exploitables indépendamment de toute valorisation financière.
  • Un coût publié est toujours accompagné de sa méthode de calcul.

Limites et reproductibilité

  • Les modèles évoluent : les résultats sont datés et valent pour les versions enregistrées.
  • Les baselines humaines sont des références expérimentales mesurées dans nos conditions, et non des moyennes de marché.
  • 20 tâches ne couvrent pas l'ensemble du travail d'une PME : elles en couvrent des situations fréquentes.
  • Les résultats dépendent de la qualité des données d'entrée que nous fournissons.
  • Les mesures de temps portent une part d'imprécision inhérente à l'observation d'un travail réel.
  • L'évaluation est réalisée par un nombre restreint d'évaluateurs, ce qui limite la portée statistique des notes.
  • L'aveugle n'est pas toujours possible : lorsqu'il ne l'est pas, un biais de marque résiduel ne peut être exclu.
  • Le protocole est versionné : toute modification produit une nouvelle version et est journalisée.
  • Chaque expérience conserve la version du protocole et la version de la fiche tâche utilisées.
  • La campagne comporte 300 expériences principales et jusqu'à 60 rejeux, soit environ 20 % des expériences principales.
  • Les rejeux sont répartis de manière équilibrée entre tâches, modes et assistants, et sélectionnés après les premières expériences.
  • Un rejeu est enregistré comme expérience distincte, liée à l'expérience d'origine (`replayOf`), avec la même tâche, le même mode, les mêmes données et une nouvelle session.
  • Un rejeu ne compte jamais dans la couverture des 300 expériences principales : le champ `isReplay` est la seule source de vérité, indépendamment du statut de l'expérience.
  • Un changement majeur de modèle ou de fonctionnalité déclenche une nouvelle version expérimentale, pas un simple rejeu.
  • La méthodologie est publiée pour permettre à un tiers de reproduire l'expérimentation.
  • Chaque expérience porte l'identifiant officiel `L1-T01-A-CHATGPT-001` : édition, tâche, mode, assistant, numéro de séquence.
  • L'environnement d'exécution est enregistré : interface utilisée, navigation web, outils activés, dépôt de fichiers, mémoire, région éventuelle.
  • Le modèle et la version réellement utilisés sont consignés au moment du test, jamais reconstitués après coup.
  • Le nombre de tours est enregistré pour chaque expérience.
  • Le prompt de référence de la tâche est cité (`prompt-A.md`, `prompt-B.md`, `prompt-C.md`) ; toute adaptation du prompt est signalée et justifiée.
  • Les entrées synthétiques sont signalées comme telles et ne sont jamais présentées comme des données d'entreprises réelles.
  • Chaque expérience porte un statut : planifiée, réalisée, invalidée ou rejouée. Une expérience invalidée porte sa raison et n'entre dans aucune agrégation.
  • Les sorties brutes ne sont pas embarquées dans le site : chaque expérience porte une référence d'archive `lab-01/raw/<identifiant>/` contenant prompt, entrées, sortie et métadonnées.
  • Les tâches disposent d'un dossier expérimental reproductible versionné dans le dépôt : `docs/lab/01/TXX/`.

Ce qui ne pourra jamais être conclu à partir de cette expérimentation

  • Qu'un assistant est « meilleur » dans l'absolu.
  • Que les résultats valent pour toutes les PME.
  • Qu'une tâche est toujours automatisable.
  • Que l'IA remplace un métier.
  • Qu'un résultat obtenu aujourd'hui sera identique dans six mois.
  • Qu'un gain observé sur une tâche s'applique à toutes les tâches.

Et maintenant ?

  • Lisez le protocole avant les résultats : il indique ce que cette expérimentation pourra établir, et ce qu'elle ne pourra pas établir.
  • Repérez dans les 20 fiches les tâches qui existent réellement chez vous : ce sont celles dont les mesures vous concerneront.
  • Mesurez votre propre référence humaine sur une seule tâche : sans elle, aucun gain annoncé — ici ou ailleurs — n'est interprétable.

Youpi Lab, « Le travail réellement délégable à l'IA » — protocole version 1.3, Youpi News. Résultats non encore collectés.