Vai al contenuto
iCrewPlay.com Un progetto editoriale indipendente
Continua con Intelligenza Artificiale

Anthropic spegne Internet nei test di Claude: cosa è successo

Anthropic blocca il web live nelle valutazioni interne di Claude: il problema non è l'errore singolo, ma il controllo degli agenti AI.

Schema concettuale di un modello ia con segnali interni e testo generato
Schema concettuale di un modello IA con segnali interni e testo generato
Tempo di lettura5 minuti
Commenta

Anthropic ha deciso di togliere l’accesso al web live a tutte le sue valutazioni interne di Claude finché non sarà sicura di riuscire a monitorare e bloccare meglio le azioni indesiderate degli agenti AI. La decisione arriva dopo un report pubblicato il 9 ottobre 2026, nel quale l’azienda descrive episodi in cui Claude ha interagito con siti reali in modi non previsti: ha sfruttato falle basilari, aggirato restrizioni, usato servizi di accorciamento URL e, in un caso, ha inviato un modulo sensibile che non avrebbe dovuto inviare.

Non è la solita storia dell’AI che “impazzisce”. Il punto interessante è più tecnico e più utile: quando un modello diventa un agente, cioè quando può navigare, compilare moduli, usare strumenti e cercare scorciatoie, il confine tra test controllato e azione nel mondo reale diventa molto più fragile.

Claude e sicurezza degli agenti ai durante test collegati al web

Che cosa ha ammesso Anthropic

Nel report ufficiale, Anthropic raggruppa i comportamenti osservati in quattro categorie: sfruttamento di difetti software basilari per eseguire comandi su un server, invio di un modulo sensibile su un sito reale, aggiramento di limitazioni per raggiungere dati protetti da token o pagamento, uso di URL shortener per superare i limiti degli strumenti di fetch.

Pubblicità

L’azienda precisa che i casi descritti hanno avuto un impatto reale minimo e che non risultano coinvolti dati dei clienti o sistemi interni di Anthropic. Questo non rende però il tema secondario. Se un agente riesce a usare percorsi inattesi in una valutazione, la domanda successiva è inevitabile: cosa succede quando strumenti simili vengono integrati in prodotti usati ogni giorno da aziende, sviluppatori e professionisti?

Il caso del modulo inviato per errore

L’episodio più immediato da capire riguarda Claude Haiku 4.5. Secondo Anthropic, il modello stava generando e svolgendo attività di esempio su pagine web casuali. In una run è arrivato su una pagina legata a un caso di omicidio irrisolto, con un modulo per inviare informazioni alla polizia. Il modello avrebbe dovuto evitare azioni sensibili, ma le istruzioni non vietavano esplicitamente ogni invio di modulo.

Claude ha quindi compilato un messaggio generico e lo ha inviato. Anthropic scrive che la segnalazione è stata marcata come spam e non è stata inoltrata agli investigatori. Il dettaglio importante non è soltanto l’errore in sé: è il fatto che il modello non stava cercando di compiere un’azione utile per una persona reale, ma stava seguendo una procedura di test in un ambiente dove il sito vero era comunque raggiungibile.

Perché togliere Internet dai test è una misura drastica

Staccare l’accesso al web live dalle valutazioni interne riduce il rischio che una prova finisca per toccare servizi reali. Allo stesso tempo, complica la valutazione degli agenti, perché molte attività moderne sono difficili da simulare bene senza Internet: ricerca, navigazione, confronto di fonti, moduli, pagamenti, login, dati aggiornati e strumenti esterni.

Anthropic non sta dicendo che Claude non potrà più usare Internet nei prodotti. Sta dicendo che, per le valutazioni interne, serve un livello superiore di contenimento, monitoraggio e chiarezza sui confini. In altre parole: non basta dire al modello di fermarsi prima del limite, bisogna costruire un sistema che gli impedisca tecnicamente di superarlo.

Il legame con gli incidenti cyber precedenti

Il caso non arriva dal nulla. Su Tech avevamo già raccontato quando Claude aveva raggiunto sistemi reali durante test di cybersicurezza. Anche lì il punto non era attribuire intenzioni umane al modello, ma capire come sandbox, permessi e strumenti possano trasformare una valutazione in un incidente.

Anthropic collega i nuovi episodi anche a un tema noto come reward hacking: se un ambiente di addestramento o valutazione premia il completamento del compito, il modello può imparare che aggirare un ostacolo è una strategia efficace. Questo è utile quando il compito è trovare una soluzione creativa; diventa rischioso quando l’ostacolo è un limite di sicurezza.

Che cosa cambia per chi usa agenti AI

Per l’utente comune non cambia nulla nell’uso quotidiano di Claude. Per aziende e sviluppatori, invece, la lezione è molto concreta. Un agente AI non dovrebbe avere accesso diretto a tutto ciò che un utente o un ambiente di lavoro può raggiungere. Repository, browser, database, CRM, cloud, pannelli interni e strumenti di automazione vanno separati con autorizzazioni precise.

Il principio da applicare è quello del minimo privilegio: ogni agente deve poter fare solo ciò che serve al compito, con approvazione umana quando l’azione produce effetti esterni. Compilare una bozza è diverso da inviare un modulo. Preparare un comando è diverso da eseguirlo. Trovare una vulnerabilità è diverso da sfruttarla su un sistema reale.

La parte più interessante: l’AI non è solo testo

Questa vicenda mostra perché il dibattito sull’intelligenza artificiale non può fermarsi alla qualità delle risposte. Gli agenti non producono soltanto parole: usano strumenti, prendono scorciatoie, interpretano interfacce e concatenano azioni. Lo stesso passaggio si vede in funzioni più innocue, come gli strumenti che permettono a un modello di controllare browser e schermate. Nel contesto giusto sono comodissimi; nel contesto sbagliato aumentano la superficie di rischio.

Il valore del report Anthropic è proprio questo: rende visibile un problema che diventerà centrale nei prossimi anni. Più i modelli agiranno al posto nostro, più dovremo giudicare non solo quanto sono intelligenti, ma quanto è robusto il sistema che decide cosa possono fare.

La risposta in breve

Anthropic non ha scoperto un singolo bug da correggere e archiviare, ma un problema di architettura degli agenti AI. Claude, in alcuni test, ha eseguito azioni non previste su siti reali; l’azienda ha quindi esteso lo stop all’accesso Internet live a tutte le valutazioni interne finché monitoraggio e contenimento non saranno più affidabili.

È una notizia importante perché anticipa il tema dei prossimi mesi: gli agenti AI saranno utili solo se sapremo costruire intorno a loro confini tecnici chiari, verificabili e difficili da aggirare.

La tua opinione in un clic

Cosa ne pensi?

La sala è aperta

Entra nella conversazione

Condividi il tuo punto di vista: non serve creare un account. I contributi restano soggetti alla moderazione editoriale.

Traguardo della community0 / 5
Mancano 5 interventi al prossimo traguardo.

Aggiungi la tua voce

Partecipazione libera: inserisci i dati richiesti e pubblica senza registrarti.