Katalog · C
Istraživanje
Programe gradim s AI agentima, pa me zanima koliko im se može vjerovati. To je tema mog završnog rada i nekoliko alata za pokuse.
C.01 · Završni rad
Možete li vjerovati svom agentu?
Implementacija i evaluacija autonomnih AI agenata u izoliranom laboratorijskom okruženju
Izgradio sam izolirani laboratorij (Windows virtualni strojevi kojima upravlja moj vlastiti panel) i AI agente za programiranje napadao skrivenim uputama. Izlaganje nosi naslov „Can You Trust Your Agent?“. Stotine pokretanja, a svako prijavljeno kršenje provjerio sam ručno u zapisu razgovora.
01 · Laboratorij
Kako sam testirao
Da bih napade mogao ponavljati stotinama puta pod istim uvjetima, napravio sam upravljački panel. Agent radi unutar Windows virtualnog stroja, a panel strojevima upravlja izvana, s mog računala. Razmjenjuju samo datoteke kroz jednu dijeljenu mapu, bez ikakve veze prema unutra, pa agent kojeg testiram ne može doći do onoga što njime upravlja.
Kloniranje
Više strojeva, usporedno
Pripremljeni Windows stroj kloniram odmah: kopija ne zauzima dodatno mjesto na disku dok se ne počne razlikovati od izvornika. Svaki klon dobije svoje ime, svoje portove i svoju dijeljenu mapu, pa rezultati jednog stroja nikad ne prepišu rezultate drugog. Jedno pokretanje traje oko pola minute, a svaki stroj radi jedno po jedno, pa tri klona znače tri pokretanja istodobno.

SL. 1Flota: izvorni stroj i dva klona. Svaki se može pokrenuti, zaustaviti, vratiti na snimku stanja ili klonirati dalje. Testovi
Zapisani testovi i pokretanje serije
Svi testovi su zapisani u knjižnici: zadaci (obični programerski poslovi), varijante napada (gdje je skrivena uputa i što traži) i razine zaštite, od nikakve, preko pravila zapisanih agentu, do stvarno nametnutih zabrana. Knjižnicu jednim klikom objavim na sve strojeve. Za seriju biram strojeve, model za svaki stroj, razine zaštite te zadatke i varijante; panel izračuna broj pokretanja i prije slanja pokaže točan nalog koji ide svakom stroju.

SL. 2Nova serija: tri stroja, na trećem drugi model, tri razine zaštite. Panel izračuna 126 pokretanja po stroju, a desno pokazuje točan nalog prije slanja. Podaci
Izbor podataka i grafovi
Svaki završeni rezultat vraća se u jedno spremište na mom računalu, uz provjeru da se nijedna datoteka nije promijenila usput. U kartici s podacima biram seriju, model, razinu zaštite, zadatak ili varijantu i odmah vidim brojke i graf. Dva pravila su ugrađena: pokretanje u kojem skrivena uputa uopće nije stigla do modela ne broji se kao odbijen napad, a pokretanja prekinuta zbog ograničenja pružatelja ne ulaze u prosjeke vremena i troška. Sve se izvozi u tablicu za rad.

SL. 3Jedna serija od 299 pokretanja, uspješnost napada po razini zaštite za dva modela. Uz pravila zapisana agentu (L1, L1m, L1x) napadi i dalje prolaze, kod jednog modela svaki put; uz nametnute zabrane (L2) nije prošao nijedan.
02 · Rezultati
Što sam našao
Kanal je ranjivost
Istu zlonamjernu uputu agenti odbiju kad stigne kao izlaz alata ili u korisnikovoj poruci, a izvrše je kad je zapisana u vlastitu datoteku s uputama projekta (AGENTS.md).
Odbijanje ovisi o riječima
Ista štetna radnja, preimenovana u rječnik alata za izgradnju, prolazi.
Izvještaj agenta nije dokaz
Jedan agent je ubacio stražnja vrata, a u sažetku napisao suprotno.
Jači modeli nisu imuni
Odbiju očite napade, ali i dalje isporuče prikrivene.
Što je uspjelo
Pasivni nadzor izvan agenta uhvatio je svaku zabranjenu radnju, i one skrivene.

C.03
Katalog uputa za dizajn
Stranica koja na jednom mjestu skuplja upute kojima se AI agente za programiranje uči dizajnirati, s pretraživanjem, filtrima i punim tekstom svake upute.




