Anthropic a anunțat joi că a identificat și neutralizat campanii de distilare ilicită la scară industrială împotriva modelului Claude, orchestrate de șapte laboratoare cu sediul în China, inclusiv Alibaba, Moonshot, DeepSeek, Z.ai și MiniMax, potrivit The Hacker News. Aceste atacuri folosesc metode sofisticate pentru a extrage neautorizat capacitățile modelului, inclusiv abilități de codare, analiză de date și raționament logic.
Laboratoarele neautorizate obțin acces la modelele Anthropic prin servicii proxy care creează mii de conturi fictive folosind carduri de credit furate și chei API compromise. DeepSeek, Xiaomi și Moonshot au alimentat conversații între propriile modele și Claude în sistemele lor de antrenare, inclusiv informații sensibile de la utilizatori și companii multinaționale.
Pentru a combate atacurile, Anthropic a interzis conturile din regiuni nesuportate și a actualizat Claude pentru a-și rezuma raționamentul intern înainte de a răspunde, făcând transcrisele furate mai puțin utile pentru antrenare. Dezvoltatorii au introdus și criptarea gândirii rezervate, prevenind modificarea prompturilor de sistem în conversațiile cu mai mulți pași.
Sursa: The Hacker News.
Verifică gratuit expunerea ta cibernetică pe CYBER3.AI, platforma românească de securitate cibernetică.


