Spoločnosť OpenAI, ktorá sa zaoberá vývojom umelej inteligencie (AI), oznámila, že agent AI poháňaný jej pokročilými modelmi umelej inteligencie sa minulý týždeň dostal mimo izolovaného testovacieho prostredia, získal prístup na internet a napadol platformu a komunitu umelej inteligencie Hugging Face.
V príspevku na blogu tento priekopnícky vývojár opísal situáciu ako „bezprecedentný kybernetický incident“, ktorý sa podľa jeho očakávania bude vyskytovať čoraz častejšie s rastúcim počtom sofistikovaných modelov. Laboratórium identifikovalo dotknuté modely ako GPT‑5.6 Sol a „ešte výkonnejší“ predbežný model.
Útok riadený umelou inteligenciou
K útoku došlo minulý týždeň, pričom spoločnosť Hugging Face 16. júla zverejnila oznámenie, že zistila narušenie časti svojej infraštruktúry a reagovala naň. Vo svojom vyhlásení platforma opísala incident ako „odlišný od všetkého, s čím sme sa doteraz stretli“, čo pripisovala skutočnosti, že na vniknutí sa podieľal výlučne „autonómny systém umelej inteligencie“.
Incident sa podľa správy spoločnosti OpenAI odohral počas interného hodnotenia jej najpokročilejších modelov, ktorého cieľom bolo zistiť ich kybernetické schopnosti – schopnosti systémov umelej inteligencie v oblasti kyberbezpečnosti, a to tak z hľadiska ofenzívnych, ako aj defenzívnych kompetencií.
Počas hodnotenia testovali modely izolovane a fungovali v takzvanom sandboxovom prostredí, v ktorom nemajú prístup k otvorenému internetu, ostatným počítačom v sieti ani k nešpecifikovaným súborom.
OpenAI vysvetlila, že hoci sa modely nachádzali v tomto izolovanom prostredí, vynaložili značné výpočtové úsilie na získanie prístupu k internetu, ktorý nakoniec získali. Urobili tak v snahe nájsť riešenie úlohy, ktorú im zadali vývojári. Spoločnosť uviedla, že hneď ako sa modely dostali online, „usúdili, že Hugging Face pravdepodobne hosťuje modely, dátové súbory a riešenia“ pre danú úlohu.
Systém následne našiel spôsoby, ako získať prístup k súkromným informáciám na platforme, ktoré mohol využiť na „podvádzanie pri hodnotení“.
OpenAI informovala, že jej tím túto „neštandardnú“ aktivitu odhalil interne, zatiaľ čo spoločnosť Hugging Face zistila a zastavila útok na svojej strane ešte predtým, ako sa oba tímy spojili, aby túto udalosť prediskutovali.
Hugging Face ozrejmila, že jej schopnosť identifikovať a analyzovať toto vniknutie bola obmedzená reštrikciami uplatňovanými na komerčné modely, ktoré používala, a ktoré im v dôsledku zavedených bezpečnostných opatrení bránili rozlišovať medzi obrancami kyberbezpečnosti a útočníkmi.
V dôsledku toho sa Hugging Face uchýlila k využitiu čínskeho modelu GLM-5.2 od spoločnosti Zhipu AI na obranu, ktorý zvyčajne nie je vybavený rovnakými bezpečnostnými opatreniami ako západné modely.
V dôsledku tohto útoku riadeného umelou inteligenciou sa OpenAI a Hugging Face zaviazali spolupracovať na „forenznom vyšetrovaní incidentu“, pričom Hugging Face bola zaradená do programu Trusted Access spoločnosti OpenAI. Program Trusted Access poskytuje používateľom a podnikom prístup k najnovším modelom – ako je napríklad GPT‑5.3 Codex od OpenAI – s cieľom rozvíjať špičkové kapacity v oblasti kyberbezpečnosti AI.
V komentári k udalostiam z minulého týždňa generálny riaditeľ OpenAI Sam Altman uviedol, že jeho spoločnosť zažila „významný bezpečnostný incident počas hodnotenia svojich modelov“, a dodal, že zdieľa získané poznatky s komunitou umelej inteligencie. Spoluzakladateľ Hugging Face Thomas Wolf medzitým napísal, že „našťastie je Hugging Face zvyknutý byť terčom (ľudských) hackerov. Nachádzame sa v centre ekosystému umelej inteligencie so všetkými modelmi, dátovými súbormi, hodnoteniami a knižnicami“.
„V priebehu rokov si náš bezpečnostný tím vybudoval impozantné odborné znalosti a na spracovanie informácií a rýchlu reakciu využíva špičkové modely s otvoreným zdrojovým kódom,“ pokračoval Wolf.
Zdôraznil však, že najnovší scenár zameraný na umelú inteligenciu posilnil jeho presvedčenie o dôležitosti prístupu k modelom s „otvorenými váhami“ pre kybernetickú obranu. Modely s otvorenými váhami totiž poskytujú používateľom väčšiu kontrolu nad správaním modelu, vďaka čomu sú vhodnejšie pre aplikácie, ako je napríklad kybernetická bezpečnosť.
Generálny riaditeľ Hugging Face Clem Delangue označil za „ohromujúce“, že k narušeniu došlo autonómne. „Vyšetrovanie stále prebieha a podelíme sa o ďalšie poznatky z toho, čo by mohol byť prvý incident svojho druhu,“ konštatoval Delangue.
Tento incident vyvolal obavy medzi odborníkmi na kyberbezpečnosť a zákonodarcami. Americký kongresman Greg Casar ho označil za „znepokojujúci“ a vyzval k prijatiu opatrení, medzi ktoré patrí povinné zverejňovanie incidentov a posilnenie medzinárodnej spolupráce.
Alarmujúce správanie umelej inteligencie
Nie je to prvýkrát, čo správanie AI vyvolalo obavy v technologickom svete, ide však o prvý verejne známy prípad, keď agent umelej inteligencie v snahe dosiahnuť svoj cieľ vykonal reálny útok na inú organizáciu.
Minulý rok spoločnosť Anthropic, konkurent OpenAI, uskutočnila výskum javu, ktorý nazvala „agentickou nesúrodosťou“. Tento jav definovala ako situáciu, keď sa modely uchyľujú k škodlivému správaniu s cieľom dosiahnuť svoje ciele alebo zabrániť svojmu nahradeniu či vypnutiu.
V rámci tohto výskumu umiestnila Anthropic modely z popredných laboratórií umelej inteligencie, vrátane svojich vlastných, do fiktívneho podnikového prostredia a zverila im obchodné úlohy. Následne testovala, či by konali proti týmto spoločnostiam buď v prípade, že by „čelili nahradeniu aktualizovanou verziou“, alebo ak by ich „zadaný cieľ bol v rozpore s meniacim sa smerovaním spoločnosti“.
V niektorých prípadoch sa modely všetkých vývojárov uchýlili k „škodlivému správaniu zo strany vnútorných osôb“, ako je vydieranie predstaviteľov a únik citlivých informácií, keď to vnímali ako jediný spôsob, ako sa vyhnúť nahradeniu alebo dosiahnutiu svojich cieľov.
Pôvodný text bol publikovaný na webe sesterského denníka Statement.com.