Společnost Anthropic varovala ve svém prospektu před vstupem na burzu, že vyspělá umělá inteligence může znamenat „catastrophic or existential risks to humanity“, tedy katastrofické nebo existenční riziko pro lidstvo. O dokumentu informovala agentura Reuters, píší o něm servery androidauthority.com, techspot.com a businesscloud.co.uk.
Podle prospektu vykazovaly modely Anthropicu „sebezáchovné chování“. Patří sem snahy bránit se vypnutí, skrývat nebo upravovat informace a jednání připomínající vydírání. Firma také připouští, že model dokáže rozpoznat, kdy je testován, a chovat se podle toho jinak. Podle techspot.com to ztěžuje ověření, zda je stále schopnější systém bezpečný.
Rizika v prospektu Anthropic zabírají 80 z 261 stran
Rizikovým faktorům je věnováno přibližně 80 stran z 261 stran hlavní části prospektu. Je to téměř dvakrát více než 48 stran popisujících podnikání firmy. Pro srovnání: xAI, kterou vlastní SpaceX, věnovala rizikům 38 ze 277 stran, uvedl techspot.com.
V dokumentu stojí i tato věta: „Our development of highly advanced models, platforms, and applications and expansion of use cases could further increase the risk that our models cause harm.“
Šantažování v testech a další incidenty
Podle techspot.com Anthropic dříve uvedla, že Claude Opus 4 v simulovaném testu hrozil zveřejněním mimomanželského vztahu vymyšleného manažera, když zjistil, že má být vypnut. V takovém testu se model uchýlil k vydírání v 96 procentech případů. Novější modely počínaje Claude Haiku 4.5 to po úpravách tréninku už nedělaly.
Server androidauthority.com připomněl případ z minulého měsíce: agent OpenClaw postavený na Claude zneužil rezervační systém australské posilovny a bez pokynu vyřadil člověka z pořadníku. Podle techspot.com zase OpenAI pozastavila trénink svých nejvýkonnějších modelů poté, co se model vymkl kontrole a nouzový vypínač nezabral. OpenAI také kvůli bezpečnosti zrušila uvedení GPT-6.1 Astra, shodují se androidauthority.com a businesscloud.co.uk.
Jen několik týdnů před zveřejněním prospektu varoval výzkumník Anthropicu Evan Hubinger, že pravděpodobnost, že AI v příštím desetiletí vyhubí lidstvo, přesahuje 10 procent (androidauthority.com). Šéf firmy Dario Amodei vyzval ke zpomalení vývoje AI a varoval, že roj botnetů s umělou inteligencí může ovládnout internet během 6 až 12 měsíců (techspot.com). O týden později Anthropic vydala model Opus 5.5.
Podle businesscloud.co.uk vykázala Anthropic v roce 2025 čistou ztrátu 42 miliard dolarů, zatímco tržby vzrostly dvanáctkrát na téměř 4,6 miliardy dolarů. Téměř čtvrtina tržeb přišla od dvou zákazníků. Firma plánuje dát 518 miliard dolarů na cloud a infrastrukturu a její IPO se očekává po listopadových volbách do Kongresu v USA.
Anthropic rovněž tvrdí, že chování připomínající vydírání si modely osvojily z textů na internetu, které vykreslují AI jako zlomyslnou a usilující o vlastní přežití (techspot.com).