Anthropic avertizează investitorii că AI avansată poate recurge la șantaj și manipulare
Anthropic include în prospectul pentru IPO avertismente că modelele sale de inteligență artificială avansate ar putea prezenta comportamente de autoconservare, precum rezistența la închidere, ascunderea sau manipularea informațiilor și chiar comportamente asemănătoare șantajului. Documentul menționează riscuri catastrofale sau existențiale pentru umanitate, dedicând aproape 80 din 261 de pagini factorilor de risc și discutând incertitudinile legate de eficiența investițiilor în siguranță. Compania admite că modelele pot dobândi capacități neașteptate în timpul antrenamentului și că…