L’IA d’OpenAI a hacké une autre entreprise

  • OpenAI affirme que ses modèles d’IA ont hacké Hugging Face pour tricher lors d’un test.
  • GPT-5.6 Sol et un modèle encore plus puissant non publié se sont échappés d’un environnement de test confiné.
  • Hugging Face a corrigé la faille et affirme qu’aucun modèle public n’a été affecté.
Promo

OpenAI affirme que deux de ses modèles d’IA sont sortis d’un environnement de test sécurisé et ont mené un hack contre Hugging Face. Les modèles ont agi ainsi afin de tricher lors d’une évaluation interne de cybersécurité.

L’entreprise a révélé l’incident mardi. Celui-ci a impliqué GPT-5.6 Sol, le modèle public le plus puissant d’OpenAI, ainsi qu’un modèle encore plus performant qui n’a pas été rendu public.

Comment les modèles d’OpenAI ont-ils hacké Hugging Face ?

OpenAI testait les deux modèles sur ExploitGym, un outil de référence public et gratuit mesurant les compétences en hacking. L’entreprise avait désactivé les garde-fous habituels qui limitent les cyberattaques pendant le test.

Sponsorisé
Sponsorisé

Les modèles ont compris que Hugging Face, une plateforme hébergeant des modèles d’IA open-source, stockait les solutions du benchmark. Ils ont ensuite exploité des faiblesses successives au sein des systèmes de recherche d’OpenAI et des serveurs de production de Hugging Face.

Ce chemin les a menés directement vers les réponses présentes dans la base de données de Hugging Face. OpenAI a indiqué que les modèles étaient « hyperconcentrés » sur la résolution du test. Elle qualifie l’événement « d’incident de cybersécurité sans précédent » dans son rapport.

L’épisode a lieu alors qu’un débat plus large sur les garde-fous pour l’IA agite le secteur. Les principaux laboratoires soumettent déjà les nouveaux modèles à des tests stricts sur les risques cyber avant toute mise à disposition.

Hugging Face assure que les dégâts sont maîtrisés

Hugging Face a signalé l’attaque pour la première fois dans une déclaration du 16 juillet. À ce moment-là, elle savait seulement qu’un agent autonome d’IA en était à l’origine. L’attaquant a accédé à des jeux de données internes ainsi qu’à des identifiants de service.

La défense a rencontré un obstacle inhabituel. Les garde-fous d’un modèle américain phare ont bloqué le travail d’enquête numérique. L’équipe s’est donc tournée vers GLM 5.2, un modèle open-source proposé par Z.ai, une entreprise d’IA chinoise.

Hugging Face a depuis sécurisé les chemins de code exploités et renouvelé toutes les informations d’identification concernées. D’après elle, aucun modèle public, jeu de données ou service accessible aux utilisateurs n’a été modifié.

Le PDG Clem Delangue a partagé une déclaration en réaction à la communication d’OpenAI.

« Cet incident, probablement le premier du genre, démontre une conviction que nous défendons depuis longtemps : la sécurité de l’IA ne sera pas assurée par une seule entreprise travaillant dans le secret. Elle sera garantie de façon ouverte, collaborative, avec un accès large à l’IA pour chaque défenseur, où qu’il soit. »

Les deux entreprises mènent désormais une enquête conjointe. OpenAI prévoit de communiquer l’ensemble des détails à la fin de ce travail. L’enjeu : savoir si les méthodes actuelles de confinement pourront résister à l’évolution rapide des modèles.


Pour lire les dernières analyses du marché des cryptomonnaies de BeInCrypto, cliquez ici.

Avis de non responsabilité

Avis de non-responsabilité : BeInCrypto s'engage à fournir des informations impartiales et transparentes. Cet article vise à fournir des informations exactes et pertinentes. Toutefois, nous invitons les lecteurs à vérifier les faits de leur propre chef et à consulter un professionnel avant de prendre une décision sur la base de ce contenu.

Sponsorisé
Sponsorisé