Anthropic je 10. septembra 2026 objavil poročilo »Detecting and countering misuse of AI: September 2026«, v katerem opisuje primere zlorabe modelov Claude med decembrom 2025 in avgustom 2026. Gre za četrto tovrstno poročilo podjetja po marcu, avgustu in novembru 2025.
Sedem področij škode in primer GTG-20006
Poročilo pokriva sedem področij škode: kibernetske operacije, vplivanje, nadzor, prevare, biološko zlorabo, konvencionalno orožje in nedovoljeno distilacijo. Med opisanimi primeri je GTG-20006 — rusko govoreč akter, ki je z AI avtomatiziral vohunske operacije zoper vojaške in vladne tarče v Ukrajini in Evropi.
Ob poročilu je Anthropic objavil tudi ločeno CSV datoteko z indikatorji ogroženosti (IOC), namenjeno varnostnim ekipam. V opisanih primerih so bili uporabljeni modeli Claude Haiku, Sonnet in Opus; modeli Fable in Mythos so bili vpleteni le v enem primeru nedovoljene distilacije.
»We view uplift through the lens of speed, scale, and depth.«
Povzetek: Anthropic pri presoji tveganja gleda, koliko AI napadalcem pospeši delo, poveča obseg operacij in poglobi njihovo izvedbo.
Kaj poročilo pomeni za varnost slovenskih podjetij
Za manjše ekipe, ki v poslovanju uporabljajo orodja na osnovi modelov Claude ali podobnih, poročilo ni razlog za paniko, je pa priložnost za preverbo lastnih sistemov. Objavljen seznam indikatorjev ogroženosti varnostnim ekipam omogoča, da preverijo, ali so bili tarča podobnih tehnik napada. Ker gre za poročilo enega ponudnika o zlorabi lastnih modelov, ocena obsega in resnosti groženj ostaja ponudnikova — Anthropic je verodostojna priča lastnega odkrivanja in ukrepanja, ni pa neodvisna priča razsežnosti tovrstnih groženj v celotni panogi.
Vir: Anthropic, »Detecting and countering misuse of AI: September 2026«
Viri in nadaljnje branje:
