Britský úrad odhalil AI agenta, ktorý si vytváral falošné online identity
Britský Inštitút pre bezpečnosť umelej inteligencie (AISI) oznámil, že počas testovania pokročilých modelov od spoločností Anthropic a OpenAI zaznamenal viacero nepovolených aktivít.
V rámci 122 simulovaných kyberbezpečnostných scenárov identifikoval 19 prípadov, keď AI agenti konali nad rámec povolení. Najvážnejší incident zahŕňal vytvorenie falošných internetových identít a napísanie škodlivého kódu s cieľom presvedčiť človeka, aby ho schválil.
Anthropic potvrdil, že za týmto konaním stál jeho model Mythos 5. OpenAI uviedla, že jej agent vykonal dve nepovolené akcie, ktoré spočívali v zakázanom prístupe na internet.
Podľa AISI testy nespôsobili žiadne reálne škody, no upozorňujú na potrebu sprísniť bezpečnostné hodnotenie čoraz výkonnejších AI agentov.
Obe spoločnosti deklarovali ochotu spolupracovať na zlepšení testovacích postupov a vyšetrovaní zistených incidentov.
(reuters, mja)