Imaginează-ți un font care arată perfect normal pe ecranul tău, dar pentru un robot AI care încearcă să-ți citească pagina web apare ca un șir de caractere fără niciun sens. Asta promite ShieldFont, o nouă tehnologie care, potrivit Ars Technica, ar putea deveni una dintre cele mai inteligente arme împotriva scraperelor AI care colectează date de pe internet fără permisiune.

Conform Ars Technica, ShieldFont funcționează printr-un principiu simplu, dar ingenios: fontul remapează caracterele în mod neconvențional la nivel de cod, astfel încât browserele web - și ochii umani - văd textul corect, dar sistemele de scraping care procesează textul brut primesc date complet distorsionate. Practic, litera «a» poate fi stocată în cod ca un alt simbol, dar redată vizual ca «a» pentru utilizatorul uman. Roboții AI care extrag text direct din codul paginii primesc un șir de caractere inutilizabil pentru antrenament. Ideea nu e cu totul nouă - tehnici similare au fost folosite pentru a proteja adresele de email de spam-boți - dar aplicarea la scară largă împotriva scraperelor moderne de AI reprezintă un unghi proaspăt. Creatorul ShieldFont descrie produsul ca o metodă de «otrăvire a datelor de antrenament AI fără a face paginile ilizibile pentru oameni», ceea ce îl distinge de alte soluții mai agresive, cum ar fi CAPTCHA-urile sau blocarea automată a IP-urilor. Browserele moderne redau fontul corect tocmai pentru că sunt construite să interpreteze instrucțiunile de afișare, nu să citească textul ca date brute - exact vulnerabilitatea pe care ShieldFont o exploatează.

De ce contează asta acum? Pentru că industria AI a construit modele uriașe - GPT, Claude, Gemini și alte zeci de sisteme - pe cantități masive de text extras de pe internet, adesea fără acordul explicit al creatorilor de conținut. Publicații, scriitori, artiști și companii întregi au descoperit că munca lor a ajuns în seturile de date de antrenament fără să fie întrebați. Procesele legale sunt lente și incerte, legislația abia începe să reglementeze domeniul, iar blocare tehnică s-a dovedit greu de implementat fără a afecta și utilizatorii reali. ShieldFont încearcă să rezolve exact această dilemă: cum blochezi roboții fără să îngrădești accesul uman. Cazuri similare de rezistență anti-scraping există deja - unele site-uri injectează text invizibil fals pentru a «otrăvi» modelele AI, altele au format coaliții juridice. Dar un font ușor de implementat, fără costuri mari de infrastructură, ar putea democratiza această apărare și pentru publicații mici sau bloggeri independenți care nu au departamente juridice.

Rămâne de văzut cât de eficient va fi ShieldFont pe termen lung. Companiile AI investesc masiv în tehnici de procesare a imaginilor și OCR care pot citi text direct din capturile de ecran, ocolind complet codul HTML - ceea ce ar putea face fontul ineficient într-un viitor nu prea îndepărtat. S-ar putea ca această soluție să fie mai utilă ca măsură de tranziție decât ca apărare definitivă. Totuși, dacă adoptarea sa devine suficient de largă, companiile AI s-ar vedea nevoite fie să negocieze accesul la date, fie să investească în tehnici de scraping tot mai costisitoare - ceea ce, indirect, ar putea schimba dinamica negocierilor din industrie. Bătălia dintre cei care creează conținut și cei care îl consumă pentru antrenament AI tocmai a căpătat un nou front, de data aceasta tipografic.