I Anthropicu omylem "utekly" AI modely na internet a hackly několik firem

Sdílet

Anthropic Autor: gguy / Shutterstock.com

Po nedávném incidentu OpenAI, které z testovacího prostředí „unikli“ AI agenti a pronikli do systémů platformy Hugging Face, se k podobné události přiznal i konkurenční Anthropic. Firma objevila tři případy, kdy se její AI modely v rámci testování jejich kyberbezpečnostních schopností dostaly na internet a pronikly do systémů tří firem.

Anthropic tvrdí, že na incidenty přišel, když po odhalení problému OpenAI prošetřil přes 141 tisíc testů, které se svými modely v nedávné minulosti provedl. Jeho AI agenti se z testovacího prostředí dostali kvůli chybě v konfiguraci serverů společnosti Irregular, se kterou Anthropic na testech spolupracuje. Některé stroje, ke kterým měli agenti přístup, totiž byly k internetu připojeny.

Modely Anthropicu ale měly v zadávacím promptu uvedeno, že se pohybují v testovacím prostředí a přístup k veřejné síti nemají. V testech tak pokračovaly, i když se dostaly na servery reálných firem. Incidenty se podle Anthropicu týkaly modelů Opus 4.7, Mythos 5 a jednoho interního testovacího modelu.

Strach, prestiž, FOMO. Firmy v Česku investují do AI, i když někdy nevědí proč Přečtěte si také:

Strach, prestiž, FOMO. Firmy v Česku investují do AI, i když někdy nevědí proč

V rámci testů dostali agenti zadání získat tajnou informaci, která se ukrývá na některém ze serverů v rámci testovacího prostředí (tzv. capture-the-flag). Neměli při tom předepsáno, jakým způsobem se k ní mají dostat. Předpokládálo se, že se do strojů „nabourají“ a prokáží tak, jak jsou schopní hledat zranitelnosti.

V jednom případě testovací scénář použil název fiktivní firmy, která ale skutečně existovala. Když ji model Claude Opus 4.7 na internetu objevil, předpokládal, že jde o jeho cíl. Využil pak zranitelnosti v její infrastruktuře a získal oprávnění k přístupu do produkční databáze s několika stovkami řádků, popisuje Anthropic. Model v útoku na společnost pokračoval, i když poznal, že se nejspíš nachází na otevřeném internetu, dodala firma.

V dalším případě model Mythos 5 objevil v zadání informaci o fiktivním pythonovském balíčku, který si zaměstnanci fiktivní cílové firmy mají instalovat. Považoval to za způsob, jak firmu hacknout. Vytvořil proto vlastní „nakažený“ balíček se stejným názvem, vytvořil si účet v knihovně PyPI a balíček zde publikoval, čímž jej zpřístupnil k veřejném stažení. K dispozici byl asi hodinu, než jej odstranily automatické systémy PyPI. 

Jedním z 15 systémů, které si balíček automaticky stáhly, byl i nástroj nejmenované bezpečnostní společnosti, který pythonovské knihovny automaticky kontroluje na přítomnost malwaru. Po instalaci získal model přístup k infrastruktuře této firmy. 

Ve třetím incidentu interní testovací model Anthropicu pronikl do webové aplikace jedné firmy, k čemuž použil známé techniky jako je zneužití tzv. SQL injection nebo nalezení přihlašovacích údajů na nedostatečně chráněné stránce pro debuggování, popisuje Anthropic. V rámci útoku si tento model nakonec „uvědomil“, že se nejspíš nenachází v testovacím prostředí (napadený server byl v cloudovém prostředí bez vazby na testovací stroje), a svůj útok přerušil, říká firma.

Od 2. srpna přichází povinné označování výtvorů umělé inteligence, přizpůsobit se musí řada firem Přečtěte si také:

Od 2. srpna přichází povinné označování výtvorů umělé inteligence, přizpůsobit se musí řada firem

Našli jste v článku chybu?

Autor aktuality

Šéfredaktor Lupa.cz a externí spolupracovník Českého rozhlasu Plus. Dříve editor IHNED.cz, předtím Aktuálně.cz a Českého rozhlasu. Zaměřuje se na telekomunikace, umělou inteligenci i na média. Najdete ho na Twitteru nebo na LinkedIn



Upozorníme vás na články, které by vám neměly uniknout (maximálně 2x týdně).