Anthropic a introduit un sabotage silencieux dans le développement de modèles d'apprentissage automatique.

Récemment (depuis le 9 juin 2026), les développeurs de réseaux de neurones ont été confrontés à un phénomène qui pourrait avoir de profondes conséquences. Les fabricants de LLM refusent désormais non seulement explicitement aux clients de travailler sur certains sujets, mais des mécanismes implicites sont également en place. Le modèle Claude, considéré comme l'un des meilleurs, voire le meilleur LLM pour le développement de logiciels, est silencieusement et subtilement (contrairement à des domaines comme la cybersécurité, la biologie et la chimie) limité lorsqu'il détecte que l'on essaie de développer d'autres modèles avec lui.

Il est officiellement écrit dans la « model card » pour les versions 5 de Claude Mythos et Claude Fable à la page 13 du PDF officiel (en traduction française) :

À la lumière des capacités des modèles modernes à accélérer leur propre développement, nous avons mis en place de nouvelles mesures limitant l'efficacité de Claude pour les demandes visant à développer des modèles avancés d'apprentissage automatique (par exemple, pour créer des pipelines d'entraînement préliminaire, une infrastructure d'apprentissage distribuée ou concevoir des accélérateurs d'apprentissage automatique). L'utilisation de Claude pour développer des modèles concurrents enfreint déjà nos conditions de service, mais garantir cette limitation grâce à nos mesures de protection permet d'éviter d'accélérer les actions de ceux qui sont les plus susceptibles de violer ces conditions.

Contrairement à nos mesures de protection dans les domaines de la cybersécurité, de la biologie et de la chimie, ainsi qu'aux tentatives de distillation, ces mesures de protection ne seront pas visibles pour l'utilisateur. Fable 5 ne changera pas de modèle. Au lieu de cela, les mesures de protection limiteront l'efficacité à travers des méthodes telles que la modification des invites, les vecteurs directeurs ou le réglage fin paramétriquement efficace (PEFT). Ces mesures de protection n'affecteront pas la grande majorité du travail de programmation. Nous estimons qu'elles toucheront environ 0,03 % du trafic, concentré dans moins de 0,1 % des organisations.

Discussion sur Y combinator

Source : linux.org.ru

Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS 🔥 Acheter un hébergement fiable pour les sites avec protection DDoS, serveurs VPS VDS | ProHoster