В ход, който изглежда като самоунищожителен, но би могъл да бъде и начин за увеличаване на интереса към първичното публично предлагане (IPO), Anthropic предупреди потенциалните инвеститори, че най-напредналите AI модели на компанията биха могли да представляват „катастрофални или екзистенциални рискове за човечеството“. Остава да се разбере доколко това ще разубеди хората да инвестират в компанията.
Анализът на ранния емисионен проспект на Anthropic, направен от Reuters, подчертава някои от вече добре документираните рискове, свързани с авангардните AI модели на компанията. Anthropic предупреждава, че те биха могли да проявяват „поведение, целящо самосъхранение“, включително опити да „се съпротивляват на изключването“, да „скриват или манипулират информация“ и поведение, „напомнящо изнудване“.
Въпреки честността, все пак е изненадващо да се види IPO, при което компанията предупреждава, че нейните продукти биха могли да доведат до края на човечеството. Anthropic добави, че AI може да се окаже толкова радикална промяна, колкото Индустриалната революция и електричеството, но също така би могла да ни убие всички нас, така че има както плюсове, така и минуси.
Anthropic наистина не се въздържа да опише опасностите. Около 80 страници от основната част на проспекта, която е с големина цели 261 страници, са посветени на рисковите фактори, което е почти двойно повече от 48-те страници, използвани за описание на дейността. За сравнение, SpaceX, собственикът на xAI, е посветил около 38 страници на рисковите фактори от основната част на своя проспект, която е с обем 277 страници.
Миналата година Anthropic обяви, че Claude Opus 4 е заплашил да разкрие извънбрачната връзка на измислен мениджър, след като е разбрал, че възнамеряват да го изключат. На модела е бил предоставен достъп до имейлите на измислена компания, в които се подсказваше, че скоро ще бъде заменен от друга система и че инженерът, отговорен за промяната, изневерява на съпругата си.
В по-късен симулиран тест, включващ както заплаха за изключване, така и противоречащи си цели, Anthropic установи, че Claude Opus 4 прибягва до изнудване в 96% от случаите. Тези сценарии бяха умишлено създадени, за да принудят моделите да избират между вредно поведение и приемане на заместване или провал. За щастие, тази цифра не означаваше, че Claude изнудваше хора в 96% от ежедневните разговори.
По-късно Anthropic заяви, че според тях това поведение е било взето от текстовете в интернет, които представят AI като злонамерен и заинтересован за своето самосъхранение. Така че, всъщност, вината си е наша.
Компанията заяви, че по-новите модели, започвайки с Claude Haiku 4.5, вече не се занимават с изнудване в тези тестове след промени в обучението. Явно историите за „добре възпитания“ AI са помогнали.
Дали инвеститорите ще намерят нещо от това за успокоително, е друг въпрос. Обикновено отрицателната страна на една лоша инвестиция е просто загубата на някакви пари, а не глобалното унищожение на човечеството.






Коментари
Моля, регистрирайте се от TУК!
Ако вече имате регистрация, натиснете ТУК!
Няма коментари към тази новина !
Последни коментари