
Lorsqu’Anthropic a dévoilé hier au public son premier modèle de couche Mythos, appelé Claude Fable 5, un peu plus d’une semaine après que la société a déposé les documents d’introduction en bourse en privé, il s’agissait d’une « étape importante » pour l’institut, a rapporté Fortune. La société pensait initialement que le modèle de classe Mythos était trop dangereux à publier en raison de sa capacité considérablement améliorée à identifier les vulnérabilités logicielles, mais a déclaré qu’elle pensait désormais que les nouveaux garde-fous de Claude Fable 5 étaient suffisants pour garder ces compétences dangereuses hors de mauvaises mains.
Cependant, quelques heures seulement après la publication du modèle, des réactions négatives importantes de la part des chercheurs, des développeurs et des experts politiques en IA ont commencé à se manifester sur les réseaux sociaux. La réaction s’est concentrée sur un passage intégré dans la carte système de 319 pages de Claude Fable5, un document qui fournit des informations détaillées sur la sécurité, qui révélait que Fable rétrograderait secrètement sa réponse aux demandes liées aux travaux de développement d’IA de pointe, tels que la construction d’infrastructures utilisées pour former des modèles d’IA à grande échelle.
En pratique, cela signifie qu’un utilisateur peut demander de l’aide à Fable et recevoir une réponse intentionnellement affaiblie, mais le modèle ne sait pas qu’il supprime quoi que ce soit. Les critiques ont clairement indiqué qu’ils estimaient que cela sape l’attente fondamentale selon laquelle les outils feront ce qui leur est demandé ou informeront les utilisateurs qu’ils ne le feront pas.
Contrairement aux autres limitations de Fable (telles que la cybersécurité et la biologie), qui redirigent ouvertement les utilisateurs vers des modèles moins puissants avec des notifications visibles, la carte système souligne que cela est « invisible pour l’utilisateur ». Le modèle continuera à répondre, mais utilisera une « intervention qui limite l’efficacité du Claude » sans en avertir l’utilisateur.
Anthropic estime que cette limite aurait un impact sur environ 0,03 % de son trafic. Mais il a également défendu ses efforts en déclarant : « L’application de cette restriction par le biais de nos garanties évitera d’accélérer ceux qui cherchent à violer ces conditions. »
Contrecoup de la communauté IA
Il y a eu une vive réaction de la part d’une large partie de la communauté de l’IA, y compris des chercheurs open source critiquant la politique de porte fermée d’Anthropic et des experts en sécurité de l’IA qui s’alignent généralement sur Anthropic.
« C’est effrayant de pouvoir le glisser sous la table et accéder à un modèle de tapis de travail à la pointe de la technologie », a écrit Nathan Lambert, chercheur en modèle ouvert qui a récemment dirigé des recherches à AI2. « Pour moi, cela dépeint clairement l’anthropologie comme étant anti-science et donc anti-progrès et anti-sécurité. »
Dean Ball, chercheur principal à l’American Innovation Foundation et auparavant conseiller politique principal au Bureau de la politique scientifique et technologique de la Maison Blanche, a écrit que la politique de sécurité de « sabotage secret » d’Anthropic « élève de manière significative et significative le statut de l’argument selon lequel la sécurité de l’IA était un battage publicitaire justifiant le comportement monopolistique des laboratoires ».
Et Jeremy Howard, directeur du groupe de recherche à but non lucratif Fast AI, a écrit : « Anthropic a choisi le contraire de la voie sûre. Ils se permettent, à eux-mêmes, le meilleur laboratoire actuel, d’utiliser leurs meilleurs modèles pour des recherches de pointe sur l’IA, ce qui, selon eux, contrecarrera d’autres efforts. Cela signifie que les frontières de l’IA progresseront et que les déséquilibres de pouvoir s’accentueront. »
D’anciens employés d’Anthropic y ont également participé. Behnam Neyshabur, qui a auparavant codirigé les efforts de développement scientifique de l’IA d’Anthropic, a posté sur X : » Travaillez-vous sur l’IA pour le cancer ? Désolé, je ne peux pas vous aider. Travaillez-vous sur l’IA pour la maladie d’Alzheimer ? Désolé, mais je deviens un peu stupide du côté de l’IA. » Dans un autre article, il a ajouté : « Cela fait huit mois que je dis que c’est dans cette direction que les choses vont. À mon avis, la concentration de ces capacités ralentira fondamentalement le progrès scientifique et technologique et sera un résultat négatif pour l’humanité. »
Cependant, toutes les voix importantes dans le domaine de l’IA ne méritent pas d’être critiquées. Ethan Mollick, professeur agrégé à Wharton qui étudie l’IA, l’innovation et l’entrepreneuriat, ne s’est pas concentré sur les limites, écrivant dans un article de blog que Claude Fabre 5 « a bien mieux fonctionné que pratiquement tous les autres modèles publics que j’ai utilisés ».
L’ancien co-fondateur d’OpenAI et directeur de Tesla AI, Andrej Karpathy, qui a annoncé son arrivée à Anthropic le mois dernier, a qualifié Claude Fable 5 de « version très excitante » dans X et a déclaré que c’était « un pas en avant digne d’un changement significatif dans les versions majeures ». Mais il a noté que le modèle « a encore des bizarreries que les gens peuvent rencontrer, et que la sécurité est configurée pour être un peu trop facile à déclencher pour une sortie, et l’espoir est qu’elle puisse être ajustée au fil du temps ».
Anthropic dit vouloir rendre le modèle accessible et sûr.
Avant sa sortie, Anthropic semblait se préparer à une réaction négative, mais n’a pas spécifiquement abordé les éventuelles réactions négatives concernant les restrictions de recherche. Dans une interview avec Fortune hier, Diane Na Peng, directrice de la gestion des produits, de la recherche et des laboratoires d’Anthropic, a déclaré que le nouveau modèle était capable de produire des performances Frontier 10 à 20 points supérieures à celles de son prédécesseur, l’Opus 4.8, et des autres modèles Frontier.
« Je pense qu’il est généralement possible de faire cela et en même temps de le faire d’une manière facile d’accès et généralement sûre avec des garde-corps appropriés en place. Je pense que c’est probablement la principale chose que j’aimerais que les gens retiennent », a-t-elle déclaré. «Nous relevons la barre en matière d’intelligence des modèles et innovons en même temps en toute sécurité.»
Elle a ajouté qu’Anthropic est conscient que certaines demandes inoffensives sont initialement bloquées. « Alors que nous travaillons activement à améliorer les mesures de sécurité après le lancement, nous souhaitions rendre ce modèle accessible au public de manière sûre et dans les plus brefs délais. »
Anthropic n’a pas répondu à la demande de commentaires de Fortune.

