L’enquête de Joseph Cox, journaliste d’investigation chez 404 Media, a été publiée le 22 septembre. Elle repose sur des documents internes et trois témoignages de prestataires.
Des missions pour évaluer les réponses des modèles
OpenAI fait appel à plusieurs milliers de prestataires pour améliorer ses modèles. Dans les projets décrits par 404 Media, certains examinent des conversations réelles avec ChatGPT. Ils doivent notamment repérer les réponses trop complaisantes ou celles qui attribuent des caractéristiques humaines au chatbot.
Le recours à ces intervenants est documenté depuis plusieurs années. En janvier 2022, OpenAI expliquait déjà le rôle des retours humains dans l’entraînement d’InstructGPT. Des évaluateurs rédigeaient des exemples de réponses attendues et classaient plusieurs propositions du modèle selon leurs préférences.
Ces données servaient ensuite à ajuster son comportement par apprentissage par renforcement avec retour humain, ou RLHF. OpenAI précisait que des mesures automatiques simples ne suffisaient pas à couvrir tous les aspects de la sécurité et de l’adéquation aux attentes des utilisateurs.
L’IA interdite pour produire et contrôler les évaluations
Selon un document consulté par 404 Media, les personnes chargées de vérifier le travail des autres prestataires doivent rédiger elles-mêmes leurs commentaires. L’interdiction couvre notamment Grammarly et la traduction par IA. Le texte exclut aussi les détecteurs de contenu IA, jugés peu fiables.
Deux témoins rapportent des exclusions pour usage de l’IA. Mercor, une entreprise qui fournit des prestataires pour l’entraînement des modèles, confirme que ses contrats interdisent le recours aux LLM, ou grands modèles de langage, pour réaliser les missions. Elle indique retirer immédiatement du projet les personnes dont elle confirme l’usage de ces outils.
OpenAI a refusé de commenter ces exclusions auprès de 404 Media.
Le parallèle avec les quality raters de Google
On peut rapprocher ces missions de celles des quality raters de Google. Google décrit ses évaluateurs comme des intervenants externes qui appliquent des consignes d’évaluation communes. Leur travail sert à mesurer la pertinence et la qualité des résultats, puis à vérifier si les changements envisagés améliorent la recherche.
Leurs notes ne fixent pas les positions des pages dans Google Search.




