Des évaluateurs des modèles d’OpenAI écartés pour usage de l’IA

Plusieurs prestataires chargés d’améliorer les modèles d’OpenAI ont été écartés pour usage de l’IA, selon 404 Media. Leurs missions exigent des évaluations humaines, et Mercor confirme cette interdiction dans ses contrats.

Open AI et Google, circuit imprimé
Illustration générée par IA — Position Zéro
Partager
Dans cet articleSommaire
  1. Des missions pour évaluer les réponses des modèles
  2. L’IA interdite pour produire et contrôler les évaluations
  3. Le parallèle avec les quality raters de Google

L’enquête de Joseph Cox, journaliste d’investigation chez 404 Media, a été publiée le 22 septembre. Elle repose sur des documents internes et trois témoignages de prestataires.

Des missions pour évaluer les réponses des modèles

OpenAI fait appel à plusieurs milliers de prestataires pour améliorer ses modèles. Dans les projets décrits par 404 Media, certains examinent des conversations réelles avec ChatGPT. Ils doivent notamment repérer les réponses trop complaisantes ou celles qui attribuent des caractéristiques humaines au chatbot.

Le recours à ces intervenants est documenté depuis plusieurs années. En janvier 2022, OpenAI expliquait déjà le rôle des retours humains dans l’entraînement d’InstructGPT. Des évaluateurs rédigeaient des exemples de réponses attendues et classaient plusieurs propositions du modèle selon leurs préférences.

Ces données servaient ensuite à ajuster son comportement par apprentissage par renforcement avec retour humain, ou RLHF. OpenAI précisait que des mesures automatiques simples ne suffisaient pas à couvrir tous les aspects de la sécurité et de l’adéquation aux attentes des utilisateurs.

Publicité

L’IA interdite pour produire et contrôler les évaluations

Selon un document consulté par 404 Media, les personnes chargées de vérifier le travail des autres prestataires doivent rédiger elles-mêmes leurs commentaires. L’interdiction couvre notamment Grammarly et la traduction par IA. Le texte exclut aussi les détecteurs de contenu IA, jugés peu fiables.

Deux témoins rapportent des exclusions pour usage de l’IA. Mercor, une entreprise qui fournit des prestataires pour l’entraînement des modèles, confirme que ses contrats interdisent le recours aux LLM, ou grands modèles de langage, pour réaliser les missions. Elle indique retirer immédiatement du projet les personnes dont elle confirme l’usage de ces outils.

OpenAI a refusé de commenter ces exclusions auprès de 404 Media.

Le parallèle avec les quality raters de Google

On peut rapprocher ces missions de celles des quality raters de Google. Google décrit ses évaluateurs comme des intervenants externes qui appliquent des consignes d’évaluation communes. Leur travail sert à mesurer la pertinence et la qualité des résultats, puis à vérifier si les changements envisagés améliorent la recherche.

Leurs notes ne fixent pas les positions des pages dans Google Search.

Jordan Belly
Auteur

Jordan Belly

Rédacteur web SEO à Toulouse, j’interviens depuis plus de vingt ans sur le contenu éditorial, dont plus de douze ans dédiés au référencement naturel. J’accompagne les entreprises dans la construction de leur visibilité en ligne, en m’appuyant sur une veille continue des évolutions de Google et des moteurs basés sur l’IA. Je continue par ailleurs à écrire pour la presse spécialisée (Système D, Le Particulier, UFC Que Choisir…) et suis l’auteur du Guide du rédacteur web (Edi.Pro).

Voir ses publications
À lire aussi

À lire ensuite