Hiljuti (alates 9. juunist 2026) on tehisintellekti arendajad silmitsi seisnud nähtusega, millel võivad olla ulatuslikud tagajärjed. LLM-i tootjad ei keela enam mitte ainult selgesõnaliselt klientidel teatud teemadega töötamist, vaid on hakanud rakendama ka varjatud mehhanisme. Tuntud mudel Claude, mida peetakse üheks parimaks või isegi parimaks LLM-iks tarkvara arendamiseks, aeglustab salaja ja märkamatult (erinevalt sellistest valdkondadest nagu küberjulgeolek, bioloogia ja keemia), kui tuvastab, et seda üritatakse kasutada teiste mudelite arendamiseks.
Ametlikult on 5. versioonide Claude Mythos ja Claude Fable 'model card' 13. lehel kaubamärgiga PDF-is kirjas (vene keeles):
Arvestades, et tänapäevaste mudelite võime oma arengut kiirendada, oleme rakendanud uusi meetmeid, mis piiravad Claude efektiivsust masinõppe arendamiseks suunatud päringutele (nt eeldatavate eelõppelõhangute, jaotatud õppimisstruktuuride või masinõppe kiirendite projekteerimise loomine). Claude kasutamine konkureerivate mudelite arendamiseks rikub juba meie teenusekasutustingimusi, kuid selle piirangu tagamine meie kaitsemeetmete abil aitab vältida nende, kes on kõige vastuvõtlikumad neid tingimusi rikkuma, tegevuste kiirenemist.
Erinevalt meie küberjulgeoleku, bioloogia ja keemia kaitsemeetmetest ning distillatsiooni katsetest, ei ole need kaitsemeetmed kasutajale nähtavad. Fable 5 ei lülitu teisele mudelile. Selle asemel piiravad kaitsemeetmed efektiivsust selliste meetodite abil nagu käsu muudatused, suunavad vektorid või parameetriliselt efektiivne peenhäälestamine (PEFT). Need kaitsemeetmed ei mõjuta enamikku programmeerimistööst. Hindame, et need mõjutavad umbes 0,03% liiklusest, mis on koondunud vähem kui 0,1% organisatsioonidest.
Arutelu saidil Y combinator
Allikas: linux.org.ru
