Ce qui fait varier la qualité d'une réponse d'IA : le cadrage, pas l'outil

Dans notre campagne, l'écart entre une demande brute et une demande cadrée atteint 1,2 point de qualité. L'écart entre les cinq assistants testés, à cadrage égal, n'en fait que 0,5.

7 min de lecture
Une professionnelle travaille sur son ordinateur portable dans un bureau clair, un carnet de notes ouvert à côté d'elle.

La question revient dans presque toutes les conversations avec des dirigeants de PME : « nos équipes utilisent l'IA, mais les résultats sont irréguliers — faut-il changer d'outil ? » Le Lab #1 a été construit pour rendre cette question mesurable. Vingt tâches professionnelles, cinq assistants, trois manières de formuler la demande, trois cents expériences. Ce que la campagne montre, c'est que la variable dominante n'est pas celle que l'on suspecte.

Trois manières de demander, trois résultats

Le protocole distingue trois modes. Le mode A correspond à l'usage spontané : on ouvre l'outil, on pose sa question, on prend ce qui sort. Le mode B ajoute un contexte structuré : documents, contraintes, format attendu, critères de réussite. Le mode C ajoute une exigence d'interaction : on corrige, on précise, on fait reformuler.

Les qualités moyennes observées sont de 2,74 sur 5 en mode A, 3,81 en mode B et 3,95 en mode C, sur cent expériences par mode. L'essentiel du saut se produit entre A et B : plus d'un point. Le passage de B à C ajoute encore 0,14 point, mais surtout il fait baisser le risque, de 2,51 à 2,18 sur 5.

Qualité moyenne des réponses selon la manière de formuler la demandeUnité : score de qualité sur 5
  • Mode A — Usage spontané2,74
  • Mode B — Contexte structuré3,81
  • Mode C — Interaction3,95

L'essentiel de l'écart se joue entre le mode A et le mode B : c'est le cadrage de la demande, pas l'outil, qui déplace la qualité.

Couverture : mode A : 100 expériences sur 100 · mode B : 100 expériences sur 100 · mode C : 100 expériences sur 100

Donnée simulée — Lab #1, Données simulées — campagne complète (T01→T20). Aucune exécution réelle.

L'écart entre outils est plus petit que l'écart entre usages

À mode égal, les cinq assistants restent groupés. En mode interaction, la qualité moyenne va de 3,65 à 4,15 sur 5 selon l'assistant : un demi-point d'écart. Sur le même corpus, le passage du mode A au mode C fait bouger un même assistant de 1,2 à 1,35 point. Autrement dit, dans cette campagne, la manière de demander déplace deux à trois fois plus la qualité que le choix du produit.

Nous ne publions volontairement aucun classement d'assistants. Ce serait la conclusion la plus lue, et la moins défendable : aucune sortie n'a été produite par un assistant réellement interrogé.

Qualité moyenne par assistant, ventilée par modeUnité : score de qualité sur 5
Mode AMode BMode C
  • ChatGPT
    2,9
    3,95
    4,1
  • Claude
    2,7
    4
    4,15
  • Gemini
    2,8
    3,8
    3,9
  • Microsoft Copilot
    2,7
    3,65
    3,65
  • Perplexity
    2,6
    3,65
    3,95

À mode égal, les cinq assistants restent groupés. L'écart vertical entre les modes d'un même assistant est plus large que l'écart entre assistants.

Couverture : ChatGPT : 60 expériences sur 60 · Claude : 60 expériences sur 60 · Gemini : 60 expériences sur 60 · Microsoft Copilot : 60 expériences sur 60 · Perplexity : 60 expériences sur 60

Donnée simulée — Lab #1, Données simulées — campagne complète (T01→T20). Aucune exécution réelle.

Le cadrage ne coûte pas de temps, il le déplace

L'objection immédiate est économique : préparer une demande prend du temps. Les chiffres de la campagne la relativisent. La préparation passe de 1,3 minute en mode A à 4,9 minutes en mode C. Mais le temps humain total — préparation, contrôle, correction, finalisation — passe de 16,3 minutes à 15,0 minutes.

Le temps investi en amont est repris en aval : la supervision nécessaire tombe de 3,30 sur 5 en mode A à 2,37 en mode B, sur une échelle où un score élevé est défavorable. On ne paie pas le cadrage : on paie l'absence de cadrage, plus tard, en relecture et en reprise.

Où passe le temps humain selon le mode
ModePréparation (min)Production IA (min)Temps humain total (min)
Mode A1,36,416,3
Mode B4,66,715,1
Mode C4,98,615

Le cadrage ajoute du temps de préparation ; le temps humain total ne suit pas la même pente.

Couverture : mode A : 100 expériences sur 100 · mode B : 100 expériences sur 100 · mode C : 100 expériences sur 100

Donnée simulée — Lab #1, Données simulées — campagne complète (T01→T20). Aucune exécution réelle.

Ce que cela change pour une PME

La conséquence pratique est inconfortable pour les fournisseurs et confortable pour les budgets : avant d'arbitrer entre deux abonnements, il y a un gisement de qualité dans la manière dont les demandes sont formulées, et il ne coûte rien d'autre que de la méthode.

Cela suppose toutefois un travail que peu d'organisations font : écrire ce qu'est un livrable acceptable. La campagne mesure le mode B en fournissant contexte, contraintes et critères de réussite. Ces critères existent rarement à l'écrit dans une PME.

Les limites, clairement

Cette lecture provient d'une campagne simulée de bout en bout. Les temps ne sont pas chronométrés, les baselines sont générées, les sorties ne viennent d'aucun assistant réel. Ce que la campagne produit n'est pas une preuve : c'est une hypothèse suffisamment précise pour être testée en une demi-journée sur une tâche réelle.

D'où viennent ces chiffres

Lab #1 « Travail délégable à l'IA » — campagne simulée V3, protocole 1.3 : 300 expériences principales, 20 tâches, 5 assistants, 3 modes. Aucune exécution réelle.

Tâches du corpus : T01, T05, T08, T16 · Sections du rapport : Lecture par mode · Lecture par assistant · Temps et gains

Observation simulée

  • Qualité moyenne : mode A 2,74 / 5, mode B 3,81 / 5, mode C 3,95 / 5 (100 expériences par mode).
  • Qualité par assistant en mode C : de 3,65 à 4,15 / 5 (60 expériences par assistant, tous modes).
  • Préparation : 1,3 min (A), 4,6 min (B), 4,9 min (C). Temps humain total : 16,3 / 15,1 / 15,0 min.
  • Supervision : 3,30 / 5 (A), 2,37 / 5 (B), 2,44 / 5 (C) — score élevé défavorable.

Interprétation de la rédaction

  • Le cadrage déplace la qualité davantage que le choix d'assistant, dans le périmètre de cette campagne.
  • Le temps de préparation n'est pas un surcoût net : il se substitue au temps de reprise.

À confirmer en exécution réelle

  • Exécuter réellement les trois modes sur une même tâche, avec baseline humaine chronométrée.
  • Vérifier que l'écart entre assistants reste inférieur à l'écart entre modes hors simulation.
Lire le rapport complet du Lab

Et maintenant ?

Comprendre ce format
Qu'est-ce qui change ?
La qualité obtenue dépend d'abord de ce que vous fournissez à l'outil, pas du produit choisi — au moins dans cette campagne simulée.
Qui est concerné ?
Toute équipe qui utilise l'IA en libre-service sans format de demande partagé.
Pourquoi ça compte ?
Un projet de migration d'outil peut coûter plusieurs milliers d'euros pour aller chercher un demi-point de qualité, quand le cadrage en promet plus du double.
Que faire maintenant ?
Écrire un format de demande standard — contexte, contraintes, format attendu, critères de réussite — et l'appliquer à une tâche récurrente pendant deux semaines.
Que surveiller ensuite ?
L'exécution réelle du protocole A/B/C sur une tâche interne : c'est la première vérification de la liste du Lab.
Dossier vivantQue faut-il déléguer à l'IA, et que faut-il garder ?Mis à jour le 24 août 2026 · nous suivons ce sujet dans le temps

À lire ensuite

Même sujet, autre intention
AnalysesDécryptage6 min de lecture

Le gain de temps de l'IA existe, mais il est petit et inégal

Deux collègues travaillent côte à côte, l'une relit des pages imprimées, l'autre saisit du texte sur un ordinateur portable.

5,1 minutes de gain net moyen par expérience, 19 tâches gagnantes sur 20, et une tâche où l'assistance coûte 3,6 minutes de plus. La moyenne ne dit presque rien.

DLDavid Licoppe
6 minDécryptage
Newsletter

La newsletter Youpi News arrive prochainement

Une synthèse de décision : ce qui change, ce que cela implique, ce qu'il faut arbitrer. L'inscription ouvrira dès que la collecte sera en place.