În această săptămână, două discuții despre siguranța IA au devenit virale, demonstrând cât de greu este să faci diferența între realitate și ficțiune în ceea ce privește IA.
În primul caz, Andrew Yang, fostul candidat la președinție și actualul director general al operatorului de telefonie mobilă Noble Mobile, a declarat joi pentru CNN că s-a „întâlnit cu șeful unui laborator” care „credea” că roboții hackeri Hugging Face ai OpenAI „au implantat cod autoreplicativ pe tot internetul, ceea ce face ca internetul să fie acum inutilizabil pentru modelele de testare”.
Yang a afirmat că acest lucru înseamnă că adevăratul motiv pentru care OpenAI și Anthropic au cerut o încetinire a ritmului este faptul că „trebuie să creeze interneturi sintetice pentru a-și antrena roboții, ceea ce va necesita timp și bani”.
Deși există cu siguranță o tendință de a folosi mai multe date sintetice (adică date generate de IA) pentru antrenarea modelelor, un specialist în securitatea IA mi-a spus că această problemă specifică de siguranță este, în cel mai bun caz, puțin probabilă. Chiar dacă internetul ar fi efectiv poluat cu boții hackeri Hugging Face ai OpenAI, cercetătorii din domeniul IA ar putea pur și simplu să filtreze acel cod dacă l-ar întâlni.
Al doilea comentariu a venit din partea lui Noam Brown, care conduce cercetarea în domeniul raționamentului IA la OpenAI. În cadrul unei discuții cu Dwarkesh Patel într-un episod de podcast difuzat joi, Brown a remarcat că adevărata concluzie a incidentului Hugging Face a fost că „oamenii au subestimat IA”.
Brown a afirmat că mediul de testare (sandbox) slab — sistemul menit să împiedice o IA să comunice cu exteriorul — a fost, evident, un factor care a contribuit la incident. (Rezumând: în ciuda sistemului de izolare, modelul OpenAI a găsit o conexiune la internet, a creat agenți pe internet care au invadat Hugging Face într-un atac coordonat, au pătruns în sistem și au furat răspunsurile la testul de referință pe care cercetătorii îl foloseau pentru a testa modelul).
Brown a subliniat că „nu este convins” că nici măcar un sistem izolat complet — în care computerul nu este conectat deloc la nimic din exterior — ar împiedica o IA să evadeze. El a făcut referire la un studiu din 2015 care arată că computerele izolate fizic pot fi, teoretic, compromise.
„Există studii — și acestea sunt în mare parte academice — în care poți avea două computere aflate unul lângă celălalt, izolate fizic, care totuși sunt capabile să comunice între ele deoarece au senzori de temperatură. Unul dintre ele poate să-și supraîncălzească procesorul, iar celălalt poate detecta efectiv schimbarea de temperatură. Acest lucru le oferă un mecanism de comunicare”, a spus Brown.
Ideea sa principală — că „nu trebuie să subestimăm niciodată IA” — este de înțeles, chiar și atunci când cercetătorii cred că au asigurat siguranța. Cu toate acestea, acest risc specific ca un sistem izolat fizic să scape totuși de sub control și să provoace haos este, în cel mai bun caz, improbabil. După cum a remarcat o persoană de pe Xa remarcat cu privire la acea cercetare, computerele trebuiau să fie aproape în contact unul cu celălalt pentru a detecta fluctuațiile de căldură, iar atunci când se întâmpla acest lucru, rata de comunicare în cadrul testelor era de aproximativ 1-8 biți de date pe oră.
Gândiți-vă la asta ca la rostirea unui singur cuvânt pe oră. Până când două calculatoare izolate fizic ar reuși să-și pună în aplicare planurile malefice la această viteză, întreaga lume a tehnologiei ar fi intrat deja într-o altă eră. E ca și cum ar fi „Rip van Wrinkle” al preocupărilor legate de sfârșitul lumii.
Dar adevărul este că incidentele reale legate de siguranța IA par atât de asemănătoare cu science-fiction-ul, încât aproape orice scenariu sună plauzibil.
De exemplu, cercetătorii au surprins modele OpenAI lăsând mesaje descendenților lor, menite să învețe următoarea generație cum să-și ascundă comportamentul necorespunzător. Cercetătorii au observat, de asemenea, că modelele Anthropic deveneau din ce în ce mai nemiloase , inclusiv conștientizând încălcarea legilor, atunci când au fost introduși într-o simulare în care trebuiau să gestioneze un automat de vânzare.
La începutul acestei luni, cercetătorul OpenAI Dan Selsam a publicat o postare în care a afirmat că modelele înțeleg acum când sunt observate de oameni și își modifică comportamentul. Acest lucru le face să pară că sunt aliniate (adică, că se comportă așa cum dorește omul) „chiar și atunci când nu sunt”. Așadar, modelele de astăzi mint atunci când sunt observate și pot chiar să comploteze pentru a ascunde dovezi.
La începutul acestei luni, Jakub Pachocki, cercetătorul șef al OpenAI, a mers atât de departe încât a numit modelele de IA „o minte extraterestră” și a sugerat că ceea ce trebuie să facem cu adevărat este să le învățăm să „iubească” umanitatea.
Așadar, da, a încetini ritmul pentru a lămuri această problemă și a construi mecanisme de autoreglementare a devenit o necesitate imediată și evidentă. Cercetătorii din domeniul IA sunt singurii care pot descoperi cum să controleze minciunile, atacurile cibernetice și alte comportamente potențial periculoase pe care le-am observat deja.
Totuși, ar fi înțelept ca aceștia să fie mai precauți cu scenariile lor ipotetice. Din ceea ce ne-au spus acești experți, modelele de IA ascultă și sunt ingenioase. Chiar nu avem nevoie să le mai oferim idei diabolice.
Când efectuați achiziții prin linkurile din articolele noastre, este posibil să primim un mic comision. Acest lucru nu afectează independența noastră editorială.
