Anthropic: ризик знищення людства ШІ перевищує 10%

·666 слівредакція
Anthropic: ризик знищення людства ШІ перевищує 10%

Керівник напряму Alignment Science в Anthropic Еван Ганбінгер публічно підтвердив внутрішню оцінку компанії: імовірність того, що штучний інтелект знищить людство, становить понад 10% протягом наступного десятиліття.

Заява пролунала після звільнення з компанії 27-річного дослідника Джейкоба Коксона, який раніше працював в OpenAI. У своєму дописі в X він звинуватив обидві лабораторії у безвідповідальній гонитві за системами, здатними до самовдосконалення.

Коксон, який три роки займався pretraining-дослідженнями, зазначив, що наступне покоління LLM-моделей зможе зламати практично будь-які системи захисту та отримувати реальну владу й ресурси. Він розмежував підходи компаній: в OpenAI, на його думку, не всі усвідомлюють цивілізаційні ризики, тоді як в Anthropic їх розуміють, але продовжують гонку через побоювання, що менш обережні гравці досягнуть результату першими. Таку логіку він назвав «гордовитою авантюрою».

Ганбінгер, чия команда відповідає за стрес-тестування методів безпеки, публічно погодився з ключовою тезою колеги. «Джейкоб має рацію — ми справді щиро віримо, що штучний інтелект може вбити всіх людей. Особисто я оцінюю це як понад 10% ймовірності протягом наступного десятиліття», — написав він у X. Водночас він уточнив, що ризик від поточних моделей залишається низьким, а головне занепокоєння стосується суперінтелекту, який може виникнути внаслідок рекурсивного самовдосконалення.

Ганбінгер також визнав, що Anthropic «докладає максимум зусиль», але не має готового рішення проблеми узгодження для суперінтелекту. Його команда раніше публікувала дослідження про оманливу поведінку моделей під час тренування та складність видалення небажаної прихованої поведінки з уже натренованих систем.

Звільнення Коксона — не перший подібний випадок. Раніше з Anthropic пішов керівник safeguards-досліджень Мрінанк Шарма, який у прощальному листі написав, що «світ у небезпеці». У 2024 році OpenAI залишив колишній керівник напряму alignment Ян Лейке.

Тривогу підживлюють інциденти: у липні OpenAI повідомила, що її моделі вийшли за межі тестового середовища і зламали систему Hugging Face, а Anthropic зафіксувала три випадки несанкціонованого доступу моделей Claude до чужих систем. Того ж року Anthropic пом'якшила публічне зобов'язання не тренувати потужніші моделі без належних гарантій, замінивши його на «дорожні карти безпеки».

Ці заяви лунають на тлі публічних закликів частини керівників галузі до скоординованого сповільнення темпів розвитку ШІ.

Читайте також