Amikor egy AI-ügynök több lépésben dolgozik, adatot keres, számol vagy külső rendszerből kér le információt, a végén rendszerint beszámol arról, mit tett. Ez a kutatás azt mutatja meg, hogyan lehet független naplók alapján ellenőrizni, hogy a jelentett lépések valóban megtörténtek-e. Vagyis: az AI azt csinálta, amit kértél tőle, vagy csak azt mondja, hogy megcsinálta?
Ellenőrzött AI-állítás
1 250
Ennyi jelentett műveletet vetett össze a kutatás független végrehajtási naplókkal, tételesen.
Auditmegállapítás
30
Ennyi dokumentált lelet tárja fel, hogyan lehet egy AI-rendszer mérését, működését és bizonyítékait is ellenőrizni.
Ez egy auditálási kérdés, nem pusztán egy AI-kérdés. Ha egy rendszer azt jelenti, hogy meghívott egy eszközt, ellenőrzött egy adatot vagy lefuttatott egy folyamatot, akkor ennek nyoma kell legyen a független naplóban. Ha nincs nyoma, a jelentés nem bizonyíték.
A kutatásban ugyanazt a rendszert kétféleképpen mérték. Az első mérőprogram túl sok hibát jelzett, és éppen azt a mintát mutatta, amit a kutató várt volna. A javított ellenőrzés után sokkal kisebb arány maradt. A tanulság egyszerű: nem elég egy szép dashboard vagy egy meggyőző összesítés. Magát az ellenőrző rendszert is tesztelni kell.
Ez a szemlélet vállalati AI-rendszerekre is alkalmazható: ellenőrizhető, hogy az ügynök tényleg elvégezte-e a kért munkát, a megfelelő adatot használta-e, és a döntése vagy jelentése visszavezethető-e konkrét műveletekre. Így a rendszer nem csak beszámol a működéséről, hanem bizonyítani is tudja azt.