La parola “honeypot” ha smesso di appartenere solo al gergo della cybersecurity ed è entrata nel vocabolario di chi fa marketing e publishing digitale. È successo quando i crawler dei grandi modelli linguistici hanno iniziato a divorare i siti web a un ritmo che nessun rapporto costi-benefici riusciva più a giustificare. Le cifre le vediamo tra poco, ma il concetto si può anticipare in una frase: i bot AI leggono migliaia di pagine per ogni singolo visitatore che restituiscono. E qualcuno, davanti a questo squilibrio, ha deciso di smettere di bloccare e ha iniziato a ingannare.
Questa pratica si chiama LLM honeypotting. Le tecniche però circolano da tempo tra sviluppatori, CDN e amministratori di sistema esasperati. In questa guida vediamo cos’è, da dove viene, come funziona in pratica, quali strumenti esistono, quali rischi comporta e se e quando ha senso prenderlo in considerazione.
Cos’è l’LLM honeypotting: significato
L’LLM honeypotting è una tattica di inganno (deception) che consiste nell’attirare i crawler AI non autorizzati dentro contenuti apparentemente plausibili ma in realtà inutili — tipicamente labirinti di pagine generate automaticamente — con due obiettivi: far salire i loro costi di scansione e, in alcuni casi, inquinare i dati che raccolgono. Il fine ultimo è rompere l’economia dello scraping su larga scala.
Il nome viene dritto dalla sicurezza informatica. Un honeypot, letteralmente “barattolo di miele”, è un sistema esca progettato per attrarre gli attaccanti, farli interagire con qualcosa di finto e studiarne le mosse mentre credono di aver trovato un bersaglio vero. È una tecnica vecchia di decenni. La novità sta nel destinatario: qui l'”attaccante” non è un hacker con intenzioni criminali, ma un bot che raccoglie contenuti per addestrare o alimentare un modello linguistico senza permesso, senza compenso e spesso ignorando il file robots.txt.
La deception in sicurezza serve da sempre a cambiare l’economia dell’attacco, più che a bloccare il traffico. Se abusare di un sistema diventa sensibilmente più costoso di quanto renda, interi modelli di business smettono di stare in piedi. Applicato ai crawler AI, significa trattare certi visitatori come attaccanti — che siano malintenzionati dichiarati o semplicemente bot indesiderati.

Attenzione all’omonimia: l’altro “LLM honeypot”
Prima di proseguire, una precisazione utile a chi cercherà approfondimenti: nella letteratura accademica “LLM honeypot” indica spesso il fenomeno inverso, cioè l’uso di modelli linguistici per costruire honeypot di cybersecurity più realistici. Ci sono ricerche in cui un LLM simula una shell Linux per intrattenere gli hacker e progetti che hanno messo in piedi trappole digitali in dieci Paesi per intercettare agenti AI autonomi impegnati in attività di hacking, raccogliendo oltre otto milioni di tentativi di attacco. Roba affascinante, ma è un altro tema. In questo articolo parliamo dell’accezione che riguarda editori, brand e marketer: le trappole tese ai crawler AI che scansionano i siti.
Perché nasce: i numeri dello squilibrio tra crawling e traffico
Per capire perché qualcuno arrivi a servire deliberatamente contenuti spazzatura ai bot, bisogna guardare i dati sul rapporto tra quanto i crawler AI prendono e quanto restituiscono.
Il patto implicito del web è sempre stato questo: tu, motore di ricerca, scansioni le mie pagine; io, sito, ricevo in cambio visitatori. Con i crawler AI questo scambio si è rotto. Cloudflare misura da tempo il cosiddetto crawl-to-refer ratio, cioè il numero di pagine scansionate per ogni visita di referral generata. I valori storici sono impressionanti: il crawler di Anthropic ha toccato un rapporto di 286.930 scansioni per ogni referral a gennaio 2025, sceso a circa 38.000:1 a luglio 2025, mentre quello di OpenAI si attestava intorno a 1.091:1. Per confronto, la ricerca tradizionale di Google viaggia su rapporti nell’ordine di poche unità: circa 4,9 pagine scansionate per visita restituita.
C’è poi il quadro d’insieme. A giugno 2026 il CEO di Cloudflare Matthew Prince ha condiviso un dato che ha fatto il giro del settore: i bot generano ormai il 57,5% del traffico HTML del web, contro il 42,5% degli esseri umani. E dentro il traffico dei crawler AI, la parte legata alla ricerca — quella che almeno in teoria può produrre una citazione o un click — era sotto il 10% delle richieste a maggio 2026; il resto è estrazione pura, contenuti prelevati per addestrare o alimentare modelli senza alcun meccanismo di ritorno.
Per un editore o un e-commerce questo si traduce in costi concreti: banda, infrastruttura, in casi estremi rallentamenti e disservizi paragonabili a un DDoS involontario. E nel frattempo il traffico organico, la valuta con cui il crawling veniva ripagato, si assottiglia. In questo contesto l’LLM honeypotting nasce come reazione: se bloccarti non funziona, ti faccio pagare il conto.
Come funziona: le tre tecniche principali
Sotto l’etichetta di LLM honeypotting convivono approcci diversi, che condividono la stessa filosofia ma agiscono su leve differenti.
1. Far lavorare di più i bot: proof-of-work e rallentamenti
La variante più soft consiste nel costringere i crawler a fare lavoro extra. Sfide di proof-of-work (piccoli calcoli che il browser deve risolvere prima di accedere alla pagina) o rallentamenti calibrati fanno sì che un essere umano non noti quasi nulla, mentre una botnet che colpisce milioni di pagine si ritrova improvvisamente con una bolletta di calcolo reale. È il principio dietro strumenti come Anubis, molto usato in ambito open source. Non c’è inganno sui contenuti: si alza semplicemente il prezzo di ogni richiesta.
2. I labirinti di contenuti: tarpit e content maze
Qui si entra nell’honeypotting vero e proprio. L’idea è intrappolare il bot in un “labirinto infinito di contenuti”: pagine generate automaticamente, verosimili all’apparenza ma prive di valore, ciascuna piena di link che portano ad altre pagine dello stesso tipo. Il crawler entra, segue i link, scende sempre più in profondità e continua a consumare tempo e budget di scansione su materiale che non gli servirà a niente. In gergo tecnico queste trappole si chiamano anche tarpit, “pozze di catrame”.
Il vantaggio rispetto al blocco è sottile ma decisivo: un 403 avvisa l’operatore del bot che è stato scoperto, e quello ruota IP, cambia user agent, torna da un proxy residenziale. Il labirinto invece dice sempre di sì, e il crawler non capisce di essere finito in una trappola. Nessun essere umano si spinge quattro link in profondità in un dedalo di contenuti generati, quindi chi lo fa è quasi certamente un bot: il labirinto funziona anche come strumento di identificazione e fingerprinting dei bad actor.
3. Avvelenare i modelli: il data poisoning
La variante più aggressiva punta oltre il costo di scansione: mira a degradare i dati stessi. Se il labirinto viene riempito di testo statisticamente coerente ma privo di senso, e quel testo finisce in un corpus di addestramento o in un sistema di retrieval, la qualità delle risposte del modello ne risente. Si distingue questa pratica dalla disinformazione classica: non si spingono narrazioni politiche o culturali, si somministra nonsense statisticamente plausibile; se poi quel nonsense riaffiora nelle risposte di un’AI, è il segnale che un modello ha raccolto dati senza pagarli, non la prova di una campagna di manipolazione.
Quanto sia realistica questa minaccia lo suggerisce la ricerca. Uno studio congiunto di Anthropic, UK AI Security Institute e Alan Turing Institute — la più ampia indagine sul poisoning condotta finora — ha mostrato che bastano appena 250 documenti malevoli inseriti nei dati di pre-addestramento per impiantare una backdoor in modelli da 600 milioni fino a 13 miliardi di parametri, a prescindere dalla dimensione del modello e del dataset. Lo studio riguardava un caso circoscritto e a basso rischio, ma il messaggio di fondo è chiaro: avvelenare un modello richiede molto meno materiale di quanto si pensasse. Nel mondo delle immagini esiste da tempo un precedente celebre, Nightshade, lo strumento con cui gli artisti alterano impercettibilmente le proprie opere per confondere i modelli text-to-image.
Gli strumenti: da Nepenthes a Cloudflare AI Labyrinth
L’ecosistema degli strumenti si divide grosso modo in due mondi: i progetti indipendenti, nati dal basso e dichiaratamente “cattivi”, e le soluzioni gestite delle grandi piattaforme edge.
Nepenthes è il capostipite dei tarpit indie: genera un albero infinito di pagine di nonsense collegate tra loro, in cui il crawler continua a scavare senza uscita. Il suo stesso autore lo definisce software deliberatamente malevolo e sconsiglia di usarlo a chi non ne comprende le conseguenze. Il problema più serio: nella sua forma grezza non distingue tra un crawler LLM e Googlebot, quindi un’installazione disattenta può farvi sparire dai risultati di ricerca.
Iocaine raffina l’approccio: funziona come reverse proxy davanti al sito, serve al bot sospetto un link avvelenato univoco e lo riconosce quando torna. Un dettaglio interessante è che non include un corpus di testo predefinito: ogni installazione usa il proprio, il che rende le trappole più difficili da riconoscere e filtrare. Anche qui, gli sviluppatori sono onesti sul carattere ostile dello strumento.
Cloudflare AI Labyrinth è la versione istituzionale della stessa idea. Quando rileva crawling non autorizzato, invece di bloccare la richiesta reindirizza il bot verso una serie di pagine generate dall’AI, abbastanza convincenti da farsi seguire ma estranee ai contenuti reali del sito protetto. La differenza sostanziale rispetto ai tool indie sta nella gestione: il labirinto è circoscritto ai soli bot sospetti, invisibile a utenti reali e motori di ricerca legittimi, e si attiva con un interruttore, senza toccare configurazioni server. Per contesto, Cloudflare dichiarava già nel 2025 oltre 50 miliardi di richieste al giorno da crawler AI sulla propria rete, poco meno dell’1% di tutte le richieste web osservate.
Il consiglio ricorrente tra chi ha sperimentato entrambi i mondi è di partire dalla soluzione gestita e, solo se serve davvero più aggressività, passare ai tool grezzi — confinandoli però su sottodomini o percorsi dedicati, esclusi via robots.txt per i bot onesti, così che la trappola scatti solo per chi il robots.txt lo ignora.
Funziona? Limiti, critiche e costi nascosti
Qui l’entusiasmo va raffreddato, perché la realtà è più disordinata della teoria.
La prima obiezione riguarda l’efficacia. L’LLM honeypotting è troppo facile da individuare e aggirare: in pratica, le pagine-labirinto spesso non vengono nemmeno mostrate ai crawler stealth, perché i sistemi di protezione non li riconoscono come bot in primo luogo. Un buon concetto, ma più a livello di marketing che di risultato concreto; la vera frizione, dice, va creata a livello di protezione. E in effetti gli operatori più smaliziati usano già ampi range di IP, proxy residenziali e user agent dinamici proprio per eludere il rilevamento.
La seconda obiezione riguarda i costi per chi difende. Generare e servire un labirinto infinito costa più che bloccare un bot. Se un bot particolarmente stupido entra nel labirinto e cinque giorni dopo ha visitato venti milioni di pagine finte, quanto vi è costato tenere in piedi la messinscena? Chi gestisce tarpit indipendenti conferma: la trappola attira traffico di proposito, e quel traffico consuma CPU e banda vostra.
La terza riserva è di sistema. C’è chi vede l’honeypotting come un’extrema ratio da considerare solo se non emergerà a breve un ecosistema sostenibile tra editori e AI; ma se si arrivasse a quel punto su larga scala, avverte, l’impatto sul web aperto sarebbe devastante. Un web in cui una quota crescente di contenuti è spazzatura sintetica seminata apposta è un problema per tutti, modelli AI inclusi — la letteratura sul model collapse, il degrado dei modelli addestrati ricorsivamente su output sintetici, è lì a ricordarlo.
Infine, un rischio molto concreto per chi lavora in ottica SEO e GEO: una trappola mal configurata non distingue i crawler. Finire nel labirinto con Googlebot, o con i bot di ricerca AI che invece vorreste accogliere perché portano citazioni e visibilità, significa sabotare la propria presenza organica. È il paradosso di questi strumenti: nascono per difendere il valore dei contenuti e, usati male, lo distruggono.
Cosa significa per chi fa marketing e publishing
Per la stragrande maggioranza dei siti, oggi, l’LLM honeypotting non è una tattica da implementare: è un fenomeno da capire. Non è una soluzione universale né un interruttore che ogni editore deve azionare. Se il sito è semplice ed economico da servire, i conti non tornano; per siti grandi e complessi, con pagine costose e ricavi reali in gioco, il calcolo cambia, soprattutto se si è già su una piattaforma edge che rende il calcolo extra più economico. Chi ci sta anche solo pensando, dice, è avanti rispetto alla curva, non indietro.
Il punto di partenza sensato è diagnostico: misurare quanto crawling AI subisce il proprio sito e quanto restituisce. Strumenti come Cloudflare Radar e le dashboard di AI Crawl Control rendono oggi visibile il crawl-to-refer ratio per singolo operatore, e distinguono il crawling di training (nessun ritorno) da quello di ricerca (potenziali citazioni e referral). Solo con questi numeri davanti si può scegliere una strategia, che nella pratica si muove lungo una scala di aggressività crescente: dichiarare le proprie regole nel robots.txt, bloccare selettivamente i crawler che danno zero ritorno, monetizzare l’accesso con modelli pay-per-crawl come quelli spinti da Cloudflare, e solo in fondo alla scala, per casi specifici, la deception.
C’è poi una considerazione strategica che riguarda proprio chi lavora sulla visibilità nei motori generativi. L’honeypotting e la GEO sono due risposte opposte allo stesso squilibrio: la prima punisce i crawler che prendono senza restituire, la seconda coltiva la presenza nelle risposte AI dove il ritorno esiste. Non sono necessariamente in contraddizione — si può accogliere il bot di ricerca di un assistente che cita le fonti e rendere la vita difficile a uno scraper anonimo che ignora ogni regola — ma richiedono di sapere esattamente chi si sta bloccando, chi si sta intrappolando e chi si sta corteggiando. La granularità è tutto.
Domande frequenti sull’LLM honeypotting
Cos’è un LLM honeypot in parole semplici? È una trappola per i bot che raccolgono contenuti per l’intelligenza artificiale: pagine finte ma verosimili, spesso organizzate in labirinti senza uscita, che fanno sprecare al crawler tempo, calcolo e denaro, e in certi casi contaminano i dati che raccoglie.
È legale? Il tema è poco esplorato e dipende dalle giurisdizioni, ma servire contenuti fittizi sul proprio sito a visitatori non autorizzati è cosa ben diversa dall’attaccare sistemi altrui. Va detto che gli autori dei tool più aggressivi, come Nepenthes e Iocaine, definiscono loro stessi il proprio software “malevolo” e invitano alla cautela. Chi opera in contesti aziendali dovrebbe comunque parlarne con un legale prima di attivare tecniche di poisoning.
L’LLM honeypotting danneggia la SEO? Può farlo, se mal configurato: un tarpit che non distingue Googlebot dai crawler AI può far sparire il sito dai risultati di ricerca. Le soluzioni gestite come AI Labyrinth mitigano il rischio circoscrivendo il labirinto ai soli bot sospetti; i tool grezzi vanno confinati su percorsi dedicati ed esclusi nel robots.txt per i crawler legittimi.
È la stessa cosa del data poisoning? Il data poisoning è una delle tecniche possibili dentro l’honeypotting, la più aggressiva: non si limita a far perdere tempo al bot, punta a degradare i dati con cui il modello viene addestrato o alimentato. Molti honeypot si fermano prima, al semplice spreco di risorse.
Devo attivarlo sul mio sito? Nella maggior parte dei casi, no, o almeno non oggi. Prima misurate il crawling AI che subite e il ritorno che genera, poi valutate le opzioni meno estreme: robots.txt, blocco selettivo, modelli di accesso a pagamento. L’honeypotting è, per ora, territorio sperimentale per siti grandi con costi di serving significativi.
In conclusione
L’LLM honeypotting è il sintomo, prima ancora che la cura. Racconta un web in cui il vecchio patto tra siti e crawler si è rotto, in cui le macchine hanno superato gli esseri umani nel traffico e in cui migliaia di pagine vengono lette per restituire un singolo visitatore. Che la risposta giusta sia il labirinto di contenuti finti, il pay-per-crawl, gli accordi di licensing o un misto di tutto questo, lo dirà il mercato nei prossimi anni. Nel frattempo, per chi fa marketing e publishing, il compito è meno spettacolare ma più urgente: sapere chi bussa alla porta del proprio sito, cosa prende e cosa lascia. Le trappole, semmai, vengono dopo.
