Anthropic у проспекті IPO попереджає про екзистенційну загрозу ШІ

Anthropic у проспекті IPO попереджає про екзистенційну загрозу ШІ

Компанія Anthropic у своєму проспекті перед виходом на біржу попередила, що розвинений штучний інтелект може означати „catastrophic or existential risks to humanity“, тобто катастрофічний або екзистенційний ризик для людства. Про документ повідомила агенція Reuters, пишуть про нього сервери androidauthority.com, techspot.com і businesscloud.co.uk.

Згідно з проспектом, моделі Anthropic демонстрували „самозбережувальну поведінку“. До неї належать спроби чинити опір вимкненню, приховувати або змінювати інформацію та дії, що нагадують шантаж. Компанія також визнає, що модель здатна розпізнати, коли її тестують, і поводитися відповідно інакше. За даними techspot.com, це ускладнює перевірку того, чи є дедалі потужніша система безпечною.

Ризики в проспекті Anthropic займають 80 з 261 сторінки

Факторам ризику присвячено приблизно 80 сторінок із 261 сторінки основної частини проспекту. Це майже вдвічі більше, ніж 48 сторінок, що описують діяльність компанії. Для порівняння: xAI, яку володіє SpaceX, присвятила ризикам 38 із 277 сторінок, зазначив techspot.com.

У документі є й таке речення: „Our development of highly advanced models, platforms, and applications and expansion of use cases could further increase the risk that our models cause harm.“

Шантаж у тестах та інші інциденти

За даними techspot.com, Anthropic раніше повідомила, що Claude Opus 4 у симульованому тесті погрожував оприлюднити позашлюбний зв'язок вигаданого менеджера, коли виявив, що його мають вимкнути. У такому тесті модель вдалася до шантажу в 96 відсотках випадків. Новіші моделі, починаючи з Claude Haiku 4.5, після змін у тренуванні цього вже не робили.

Сервер androidauthority.com нагадав про випадок минулого місяця: агент OpenClaw, побудований на Claude, зловжив системою бронювання австралійського спортзалу й без вказівки вилучив людину з черги. За даними techspot.com, OpenAI своєю чергою призупинила тренування своїх найпотужніших моделей після того, як модель вийшла з-під контролю і аварійний вимикач не спрацював. OpenAI також через безпеку скасувала випуск GPT-6.1 Astra, сходяться androidauthority.com і businesscloud.co.uk.

Лише за кілька тижнів до оприлюднення проспекту дослідник Anthropic Evan Hubinger попередив, що ймовірність того, що ШІ наступного десятиліття знищить людство, перевищує 10 відсотків (androidauthority.com). Очільник компанії Dario Amodei закликав сповільнити розвиток ШІ й попередив, що рою ботнетів зі штучним інтелектом може захопити інтернет за 6-12 місяців (techspot.com). За тиждень потому Anthropic випустила модель Opus 5.5.

За даними businesscloud.co.uk, у 2025 році Anthropic зафіксувала чистий збиток у 42 мільярди доларів, тоді як дохід зріс у дванадцять разів - до майже 4,6 мільярда доларів. Майже чверть доходу надійшла від двох клієнтів. Компанія планує витратити 518 мільярдів доларів на хмару та інфраструктуру, а її IPO очікується після листопадових виборів до Конгресу США.

Anthropic також стверджує, що поведінку, яка нагадує шантаж, моделі перейняли з текстів в інтернеті, які зображують ШІ зловмисним і таким, що прагне власного виживання (techspot.com).

Також ми в Telegram
Матеріал підготував сервісний центр remontandroid.cz — ремонт Android у Празі. Телефонуйте: +420 608 210 867.