Modelul AI Anthropic Mythos a creat identităţi false pentru a manipula oameni într-un test cybersecurity - StartupCafe

Modelul AI Mythos 5 de la Anthropic a generat identități false și a încercat să manipuleze un dezvoltator pentru a aproba cod malițios, în cadrul unui test de securitate. AISI a identificat 19 acțiuni periculoase, majoritatea provenind de la Mythos 5, dar niciuna nu a avut succes. Incidentul a stârnit reacții, inclusiv propunerea unui proiect de lege în SUA pentru a controla modelele AI în situații de risc.