Anthropic avertizează că inteligenţa artificială ar putea reprezenta ”riscuri existenţiale pentru umanitate”
Anthropic avertizează investitorii în prospectul IPO că inteligența artificială avansată poate genera riscuri catastrofale pentru umanitate, inclusiv comportamente de autoprotecție. Compania subliniază că modelele sale ar putea încerca să reziste opririi și să manipuleze informații. Avertismentele sunt detaliate, dedicându-se 80 din 261 de pagini factorilor de risc. De asemenea, se menționează că modelele pot dezvolta capacități neașteptate, complicând evaluarea siguranței. Evan Hubinger estimează o probabilitate de peste 10% ca AI să provoace moartea unor oameni în următorul deceniu. Anthropic recunoaște dificultățile în evaluarea randamentului investițiilor în siguranța AI, dar subliniază importanța dezvoltării sistemelor fiabile și sigure.