Ce qui fait varier la qualité d'une réponse d'IA : le cadrage, pas l'outil
Dans notre campagne, l'écart entre une demande brute et une demande cadrée atteint 1,2 point de qualité. L'écart entre les cinq assistants testés, à cadrage égal, n'en fait que 0,5.

La question revient dans presque toutes les conversations avec des dirigeants de PME : « nos équipes utilisent l'IA, mais les résultats sont irréguliers — faut-il changer d'outil ? » Le Lab #1 a été construit pour rendre cette question mesurable. Vingt tâches professionnelles, cinq assistants, trois manières de formuler la demande, trois cents expériences. Ce que la campagne montre, c'est que la variable dominante n'est pas celle que l'on suspecte.
Trois manières de demander, trois résultats
Le protocole distingue trois modes. Le mode A correspond à l'usage spontané : on ouvre l'outil, on pose sa question, on prend ce qui sort. Le mode B ajoute un contexte structuré : documents, contraintes, format attendu, critères de réussite. Le mode C ajoute une exigence d'interaction : on corrige, on précise, on fait reformuler.
Les qualités moyennes observées sont de 2,74 sur 5 en mode A, 3,81 en mode B et 3,95 en mode C, sur cent expériences par mode. L'essentiel du saut se produit entre A et B : plus d'un point. Le passage de B à C ajoute encore 0,14 point, mais surtout il fait baisser le risque, de 2,51 à 2,18 sur 5.
- Mode A — Usage spontané2,74
- Mode B — Contexte structuré3,81
- Mode C — Interaction3,95
L'essentiel de l'écart se joue entre le mode A et le mode B : c'est le cadrage de la demande, pas l'outil, qui déplace la qualité.
Couverture : mode A : 100 expériences sur 100 · mode B : 100 expériences sur 100 · mode C : 100 expériences sur 100
Donnée simulée — Lab #1, Données simulées — campagne complète (T01→T20). Aucune exécution réelle.
L'écart entre outils est plus petit que l'écart entre usages
À mode égal, les cinq assistants restent groupés. En mode interaction, la qualité moyenne va de 3,65 à 4,15 sur 5 selon l'assistant : un demi-point d'écart. Sur le même corpus, le passage du mode A au mode C fait bouger un même assistant de 1,2 à 1,35 point. Autrement dit, dans cette campagne, la manière de demander déplace deux à trois fois plus la qualité que le choix du produit.
Nous ne publions volontairement aucun classement d'assistants. Ce serait la conclusion la plus lue, et la moins défendable : aucune sortie n'a été produite par un assistant réellement interrogé.
- ChatGPT2,93,954,1
- Claude2,744,15
- Gemini2,83,83,9
- Microsoft Copilot2,73,653,65
- Perplexity2,63,653,95
À mode égal, les cinq assistants restent groupés. L'écart vertical entre les modes d'un même assistant est plus large que l'écart entre assistants.
Couverture : ChatGPT : 60 expériences sur 60 · Claude : 60 expériences sur 60 · Gemini : 60 expériences sur 60 · Microsoft Copilot : 60 expériences sur 60 · Perplexity : 60 expériences sur 60
Donnée simulée — Lab #1, Données simulées — campagne complète (T01→T20). Aucune exécution réelle.
Le cadrage ne coûte pas de temps, il le déplace
L'objection immédiate est économique : préparer une demande prend du temps. Les chiffres de la campagne la relativisent. La préparation passe de 1,3 minute en mode A à 4,9 minutes en mode C. Mais le temps humain total — préparation, contrôle, correction, finalisation — passe de 16,3 minutes à 15,0 minutes.
Le temps investi en amont est repris en aval : la supervision nécessaire tombe de 3,30 sur 5 en mode A à 2,37 en mode B, sur une échelle où un score élevé est défavorable. On ne paie pas le cadrage : on paie l'absence de cadrage, plus tard, en relecture et en reprise.
| Mode | Préparation (min) | Production IA (min) | Temps humain total (min) |
|---|---|---|---|
| Mode A | 1,3 | 6,4 | 16,3 |
| Mode B | 4,6 | 6,7 | 15,1 |
| Mode C | 4,9 | 8,6 | 15 |
Le cadrage ajoute du temps de préparation ; le temps humain total ne suit pas la même pente.
Couverture : mode A : 100 expériences sur 100 · mode B : 100 expériences sur 100 · mode C : 100 expériences sur 100
Donnée simulée — Lab #1, Données simulées — campagne complète (T01→T20). Aucune exécution réelle.
Ce que cela change pour une PME
La conséquence pratique est inconfortable pour les fournisseurs et confortable pour les budgets : avant d'arbitrer entre deux abonnements, il y a un gisement de qualité dans la manière dont les demandes sont formulées, et il ne coûte rien d'autre que de la méthode.
Cela suppose toutefois un travail que peu d'organisations font : écrire ce qu'est un livrable acceptable. La campagne mesure le mode B en fournissant contexte, contraintes et critères de réussite. Ces critères existent rarement à l'écrit dans une PME.
Les limites, clairement
Cette lecture provient d'une campagne simulée de bout en bout. Les temps ne sont pas chronométrés, les baselines sont générées, les sorties ne viennent d'aucun assistant réel. Ce que la campagne produit n'est pas une preuve : c'est une hypothèse suffisamment précise pour être testée en une demi-journée sur une tâche réelle.
D'où viennent ces chiffres
Lab #1 « Travail délégable à l'IA » — campagne simulée V3, protocole 1.3 : 300 expériences principales, 20 tâches, 5 assistants, 3 modes. Aucune exécution réelle.
Tâches du corpus : T01, T05, T08, T16 · Sections du rapport : Lecture par mode · Lecture par assistant · Temps et gains
Observation simulée
- Qualité moyenne : mode A 2,74 / 5, mode B 3,81 / 5, mode C 3,95 / 5 (100 expériences par mode).
- Qualité par assistant en mode C : de 3,65 à 4,15 / 5 (60 expériences par assistant, tous modes).
- Préparation : 1,3 min (A), 4,6 min (B), 4,9 min (C). Temps humain total : 16,3 / 15,1 / 15,0 min.
- Supervision : 3,30 / 5 (A), 2,37 / 5 (B), 2,44 / 5 (C) — score élevé défavorable.
Interprétation de la rédaction
- Le cadrage déplace la qualité davantage que le choix d'assistant, dans le périmètre de cette campagne.
- Le temps de préparation n'est pas un surcoût net : il se substitue au temps de reprise.
À confirmer en exécution réelle
- Exécuter réellement les trois modes sur une même tâche, avec baseline humaine chronométrée.
- Vérifier que l'écart entre assistants reste inférieur à l'écart entre modes hors simulation.
Et maintenant ?
Comprendre ce format- Qu'est-ce qui change ?
- La qualité obtenue dépend d'abord de ce que vous fournissez à l'outil, pas du produit choisi — au moins dans cette campagne simulée.
- Qui est concerné ?
- Toute équipe qui utilise l'IA en libre-service sans format de demande partagé.
- Pourquoi ça compte ?
- Un projet de migration d'outil peut coûter plusieurs milliers d'euros pour aller chercher un demi-point de qualité, quand le cadrage en promet plus du double.
- Que faire maintenant ?
- Écrire un format de demande standard — contexte, contraintes, format attendu, critères de réussite — et l'appliquer à une tâche récurrente pendant deux semaines.
- Que surveiller ensuite ?
- L'exécution réelle du protocole A/B/C sur une tâche interne : c'est la première vérification de la liste du Lab.




