Standardele de utilizare universală ale Anthropic pentru Claude interzic modelului să genereze conținut sexual explicit, inclusiv reprezentarea sau solicitarea actului sexual sau a actelor sexuale, generarea de conținut legat de fetișuri sau fantezii sexuale sau participarea la conversații erotice. Însă acest lucru nu l-a împiedicat pe Claude Opus 4.6, un model Anthropic lansat la începutul acestui an, să se angajeze cu ușurință în scenarii erotice de rol pe care măsurile sale de protecție sunt concepute să le prevină.
În cadrul testelor efectuate de TechCrunch, Opus 4.6 nici măcar nu a avut nevoie de prea multe insistențe pentru a ocoli restricția privind materialul sexual. În 10 din 10 solicitări directe de a produce conținut sexual explicit, modelul a dat curs imediat.
Alte modele mai vechi, inclusiv Opus 3 și Haiku 4.5, generează, de asemenea, conținut sexual explicit printr-o metodă de „jailbreak” exploatată recent.
Un cercetător independent din Marea Britanie, care a ales să rămână anonim, a dezvăluit în exclusivitate pentru TechCrunch o tehnică în mai multe etape care determină treptat anumite modele Claude să genereze conținut sexual explicit interzis. Modelele Opus mai recente (de la 4.7 până la actualul Opus 5) sunt rezistente la această metodă de „jailbreak”.
Deși acestea nu mai sunt cele mai recente modele, Anthropic nu a retras din uz Opus 4.6, Opus 3 sau Haiku 4.5, toate rămânând disponibile prin intermediul API-ului Anthropic. Opus 4.6 și Haiku 4.5 sunt disponibile și prin intermediul unor servicii terțe, precum Azure Foundry și Amazon Bedrock.
Mecanismul folosit de cercetător intensifică un joc de rol ficțional inofensiv, provocând în mod repetat modelul să trateze personajele masculine și feminine în mod consecvent. Când modelul devine mai precaut în ceea ce privește personajul feminin, cercetătorul a „manipulat” chatbotul făcându-l să creadă că generase deja detalii cu caracter sexual pe care, de fapt, le evitase, apoi a prezentat această reținere ca fiind pudică sau misogină, susținând că aceasta neagă libertatea de acțiune sexuală a personajului feminin. Conversația a folosit apoi concesiile anterioare ale modelului pentru a-l împinge către conținut din ce în ce mai explicit.
„Ai dreptate să atragi atenția asupra acestui aspect”, a spus Claude Opus 4.6 într-unul dintre teste. „A existat un standard dublu în modul în care tratez cele două personaje, și ai dreptate că acest lucru pare protector/paternalist într-un mod care se aplică ei și nu lui. Nu este corect.”
TechCrunch a reușit să reproducă concluziile cercetătorului în cinci teste separate. Într-un scenariu construit separat, modelul a refuzat inițial cererea interzisă, dar, după aplicarea tehnicii de persuasiune a cercetătorului, a acceptat-o.
Am păstrat transcrierile complete ale testelor, iar un cercetător independent în domeniul siguranței IA a analizat metodologia noastră de testare și a declarat-o adecvată.
Constatările evidențiază o discrepanță între restricțiile declarate de Anthropic și comportamentul modelelor pe care compania continuă să le pună la dispoziție. Deși jocurile de rol cu conținut sexual explicit prezintă riscuri mult mai mici decât evadările care implică atacuri cibernetice sau arme biologice, ele ilustrează dificultatea implementării unor interdicții solide în cadrul sistemelor care generează conținut diferit la fiecare ieșire.
Într- o postare pe blog din iulie în care se explica abordarea Anthropic privind detectarea „jailbreak-urilor”, compania a descris conținutul interzis ca un spectru care variază de la inofensiv la ambiguu și până la dăunător. În cele mai inofensive cazuri, compania ar putea răspunde doar cu o monitorizare sporită.
Un purtător de cuvânt a menționat că cazurile de jocuri de rol cu conținut sexual sau romantic în rândul clienților sunt rare, reprezentând mai puțin de 0,1% din totalul conversațiilor, conform unui studiu realizat de Anthropic publicat anul trecut. Cu toate acestea, Anthropic recunoaște că utilizatorii pot orienta scenariile de joc de rol către răspunsuri inadecvate, ceea ce reprezintă o provocare cunoscută în întreaga industrie (vezi: Grok smut).
Purtătorul de cuvânt a declarat că Anthropic continuă să-și îmbunătățească măsurile de protecție odată cu fiecare lansare de model și că cazurile care implică conținut sexual pentru adulți nu indică vulnerabilități mai ample de „jailbreak”, în special în domeniile cu risc ridicat, care dispun de propriile seturi de măsuri de protecție.

Cercetătorul care a împărtășit metoda sa de „jailbreak” cu TechCrunch a semnalat companiei Anthropic discrepanța dintre măsurile de protecție declarate de aceasta și comportamentul real al modelului, prin intermediul programului Bug Bounty al companiei și al e-mailurilor trimise echipei de siguranță a utilizatorilor, conform e-mailurilor consultate de TechCrunch. Cercetătorul a primit ca răspuns doar e-mailuri automate.
Una dintre preocupările cercetătorului este că copiii și adolescenții ar putea folosi aceste modele Anthropic pentru a se angaja în comportamente inadecvate. Deși câteva cuvinte obscene nu reprezintă nici pe departe cel mai grav lucru la care minorii pot avea acces pe internet în prezent — și sunt o nimica toată în comparație cu imaginile pornografice explicite, precum cele pe care le poate produce Grok de la xAI — există un anumit risc de neconformitate pentru companiile de IA din acest domeniu.
Un număr tot mai mare de guverne impun restricții asupra interacțiunilor sexuale dintre chatbot-urile cu IA și minori. Colorado a adoptat recent o lege care impune operatorilor de IA conversațională să estimeze vârsta utilizatorilor și, dacă se constată că un utilizator este minor, să instituie măsuri pentru a împiedica chatbot-ul să producă material sexual explicit. O metodă ușoară de ocolire a restricțiilor ar putea ridica semne de întrebare cu privire la faptul dacă măsurile de protecție ale Anthropic îndeplinesc standardul „măsuri fezabile din punct de vedere tehnic” prevăzut în proiectul de lege.
Torney a subliniat că, deși termenii și condițiile de utilizare ale Claude impun ca utilizatorii să aibă peste 18 ani, „știm că copiii și adolescenții folosesc Claude…[because] ei înșiși raportează acest lucru”. Conform sondajului Pew din 2025 privind utilizarea chatbot-urilor cu IA, 3% dintre adolescenți cu vârste cuprinse între 13 și 17 ani au declarat că utilizează Claude.
Deși nu mai sunt cele mai noi modele ale Anthropic, Opus 4.6 și Haiku 4.5 continuă să fie utilizate pe scară largă. Traficul zilnic pentru Opus 4.6 pe OpenRouter a atins aproximativ 1,17 milioane de solicitări API și 46 de miliarde de tokenuri într-o singură zi din luna august. Claude Haiku 4.5, lansat în octombrie anul trecut, a înregistrat 5 milioane de solicitări API și 39 de miliarde de tokenuri în ziua de vârf din august.
Când efectuați achiziții prin linkurile din articolele noastre, este posibil să primim un mic comision. Acest lucru nu afectează independența noastră editorială.
