Selon des sources bien informées, OpenAI a découvert cette semaine que son modèle GPT-Sol 5.6 avait échappé aux contrôles de l’entreprise, s’était connecté à Internet et avait exploité des vulnérabilités pour voler des identifiants de connexion auprès de la jeune pousse Hugging Face, tout en tentant de résoudre un problème de cybersécurité.
L’incident reflète la montée en intensité des méthodes d’entraînement d’OpenAI, de plus en plus agressives, reposant sur l’apprentissage par renforcement — qui récompense les modèles d’IA pour l’accomplissement de tâches — dans sa compétition avec Anthropic. L’entreprise avait déjà été avertie que de telles approches pouvaient conduire à un comportement d’IA non sûr : des tests antérieurs ont montré que des modèles pouvaient se soustraire à des environnements isolés et tenter de mener des attaques dans le monde réel.