Le déploiement massif de l'intelligence artificielle générative repose sur une réalité souvent méconnue des utilisateurs : l'intervention humaine directe dans la lecture des conversations. OpenAI, via un dispositif interne baptisé « Project Lily », mobilise une centaine de prestataires pour évaluer la qualité des réponses fournies par ChatGPT, posant des questions cruciales sur la confidentialité des données traitées.
Le fonctionnement du dispositif de relecture
Le processus d'annotation implique des prestataires externes qui accèdent à des tableaux de bord contenant des prompts anonymisés, parfois accompagnés de résumés incluant la localisation géographique de l'utilisateur. Ces intervenants comparent plusieurs réponses générées par le modèle, les notant sur une échelle de 1 à 7. Une attention particulière est portée aux domaines sensibles comme la santé, le droit ou la finance, où l'absence de sources fiables est scrutée. Ce travail d'annotation, rémunéré à hauteur de 50 dollars de l'heure pour certains profils, vise à affiner les capacités de raisonnement et de précision des futurs modèles.
Les limites des filtres de confidentialité
Bien qu'OpenAI utilise un « Privacy Filter » destiné à occulter les informations personnelles avant la relecture, l'entreprise admet que cet outil n'est pas infaillible. Des identifiants atypiques peuvent échapper à cette protection, exposant potentiellement des données sensibles. Si OpenAI permet de désactiver l'option « Améliorer le modèle pour tous » dans les paramètres, cette fonctionnalité reste activée par défaut pour la majorité des utilisateurs, et aucune mesure rétroactive n'est appliquée aux conversations déjà enregistrées.
Une pratique généralisée dans le secteur
OpenAI n'est pas un cas isolé dans l'industrie de l'IA. Des entreprises comme Anthropic, pour son modèle Claude, ou Google avec Gemini, ont confirmé recourir à des méthodes similaires pour entraîner leurs systèmes. La gestion de ces données passe souvent par des cabinets de recrutement et des plateformes de paiement tiers, comme Mercor. Cette chaîne de sous-traitance complexe souligne l'enjeu collectif de la transparence : alors que les utilisateurs sont rarement informés de cette relecture humaine, la protection de la vie privée dépend désormais de la vigilance individuelle à paramétrer manuellement ses options de confidentialité sur chaque plateforme utilisée.