GEO sì, ma con controllo. Come gestire crawler, training e agenti AI

Oggi i brand si pongono sempre più spesso il tema della visibilità nelle risposte generate dall’AI: comparire in ChatGPT, nelle AI Overviews e nella AI Mode di Google, in Gemini, Copilot, Perplexity e negli altri motori generativi è diventato uno degli obiettivi della GEO, la Generative Engine Optimization.

Ma rendere un contenuto accessibile ai sistemi AI non significa necessariamente autorizzarne qualsiasi utilizzo.

Un’azienda può voler rendere disponibili articoli, guide, pagine prodotto e case study affinché possano essere trovati e citati nelle risposte generate dall’AI, senza per questo voler concedere gli stessi contenuti per l’addestramento dei modelli.

Allo stesso modo, può voler consentire la consultazione di alcune pagine da parte di agenti AI, ma impedire loro di accedere a form, checkout, aree riservate o dati proprietari.

La domanda diventa quindi: è possibile controllare come i sistemi AI accedono e utilizzano i contenuti di un sito? Sì, ma con alcune precisazioni.

Nella SEO tradizionale siamo abituati a ragionare soprattutto in termini di crawling e indicizzazione, con l’AI il quadro diventa ancora più articolato, perché la stessa risorsa online può essere utilizzata per finalità diverse.

I tre modi in cui i sistemi AI possono utilizzare un sito

1. Crawling per il training

In questo caso i contenuti vengono raccolti per contribuire alla costruzione di dataset, all’addestramento o al fine-tuning di modelli AI.

Il contenuto può quindi contribuire al comportamento futuro del modello senza che, nel momento in cui un utente riceve una risposta, venga necessariamente mostrato un link o generata una visita verso il sito originario.

È il caso più delicato per editori e aziende che investono nella produzione di contenuti proprietari: studi, report, database, immagini, ricette, guide specialistiche, comparazioni, template o documentazione tecnica.

Diversi operatori consentono ormai di esprimere preferenze specifiche. OpenAI, ad esempio, distingue GPTBot, utilizzato per il crawling di contenuti che possono essere impiegati per migliorare e addestrare i propri modelli generativi, da OAI-SearchBot, dedicato invece alle funzionalità di ricerca di ChatGPT.

Questo rende possibile, almeno per gli operatori che prevedono questa separazione, bloccare il training senza rinunciare automaticamente alla possibilità di comparire nelle risposte generate attraverso la ricerca web.

2. Search e retrieval

Il secondo caso riguarda il recupero di informazioni dal web per rispondere a una domanda dell’utente.

Un assistente AI può cercare una fonte, recuperare una pagina e utilizzarne le informazioni nel momento in cui genera una risposta. Questo non significa necessariamente che quella pagina sia stata utilizzata per addestrare il modello.

Dal punto di vista della GEO è il canale più interessante, perché permette a un brand di essere trovato, utilizzato come fonte e, quando previsto dal servizio, citato attraverso un link.

Bloccare indiscriminatamente questa tipologia di accesso può quindi ridurre le opportunità di discovery, citazione, referral traffic e presenza nelle risposte AI.

Nel caso di OpenAI la distinzione è esplicita: OAI-SearchBot determina la possibilità per un sito di essere mostrato nelle funzionalità Search di ChatGPT ed è gestibile separatamente da GPTBot.

3. Navigazione e azioni da parte degli agenti AI

La terza categoria è diversa sia dal training sia dalla ricerca.

Gli agenti AI possono visitare un sito in tempo reale per conto dell’utente, leggere pagine, confrontare prodotti, recuperare informazioni, compilare form o interagire con servizi digitali.

Nel caso di OpenAI, per esempio, alcune richieste avviate direttamente dagli utenti possono utilizzare lo user agent ChatGPT-User. OpenAI precisa che queste visite non costituiscono crawling automatico e che, proprio perché originate da una richiesta dell’utente, le normali regole di robots.txt potrebbero non essere applicabili allo stesso modo.

Per un sito informativo questo tipo di accesso può essere utile. Per un e-commerce, un portale B2B, un sito con aree clienti, form, sistemi di prenotazione o contenuti monetizzati richiede invece controlli più accurati.

Search, Training e Agent: il modello Cloudflare

Una delle evoluzioni più interessanti arriva da Cloudflare, che ha introdotto controlli distinti in base al comportamento dei bot AI:

  • Search, per crawler utilizzati per raccogliere o indicizzare contenuti destinati alla ricerca;
  • Training, per crawler che acquisiscono contenuti destinati all'addestramento o al fine-tuning;
  • Agent, per attività automatizzate svolte in tempo reale per conto di un utente.

Da settembre 2026 Cloudflare applica questa distinzione anche ai cosiddetti mixed-use crawlers, bot che possono essere utilizzati contemporaneamente per ricerca e training.

Ha inoltre introdotto l'opzione Disallow AI Training, pensata per esprimere il rifiuto all'utilizzo dei contenuti per training senza dover necessariamente bloccare il crawler e perdere la relativa visibilità nella ricerca.

Una policy diversa per ogni tipo di contenuto

La soluzione più efficace non è decidere se “aprire” o “chiudere” tutto il dominio agli AI crawler, ma classificare i contenuti in base al livello di esposizione desiderato.

Contenuti da rendere scopribili

Sono le pagine che devono continuare a competere nella ricerca tradizionale e, contemporaneamente, contribuire alla presenza del brand nelle esperienze generative:

  • pagine di servizio e prodotto;
  • guide, FAQ e contenuti editoriali;
  • case study pubblici;
  • contenuti di thought leadership;
  • pagine dedicate a mercati, settori e soluzioni;
  • contenuti local.

Per queste risorse la priorità è mantenere disponibile l'accesso destinato alla ricerca.

La decisione di autorizzare o meno il training è invece un tema distinto e deve dipendere dalla policy aziendale sulla proprietà intellettuale e sull'utilizzo dei contenuti.

Contenuti pubblici, ma non destinati al training

Una seconda categoria comprende contenuti che l'azienda vuole rendere trovabili e consultabili, ma sui quali desidera mantenere maggiore controllo.

Per esempio:

  • report proprietari;
  • insight e ricerche originali;
  • studi di settore;
  • comparazioni editoriali;
  • immagini originali;
  • template;
  • database;
  • materiali scaricabili;
  • contenuti il cui valore deriva anche dalla loro unicità.

In questo caso può avere senso mantenere l'accesso per la ricerca e dichiarare contemporaneamente il divieto di utilizzo per training.

Il controllo tecnico dovrebbe essere accompagnato anche da condizioni d'uso chiare, copyright, licenze e monitoraggio dei bot.

robots.txt, infatti, esprime una preferenza verso i crawler che scelgono di rispettarlo: da solo non rappresenta una barriera tecnica.

Contenuti che devono restare privati

Infine ci sono risorse che non dovrebbero essere accessibili né ai motori di ricerca né ai sistemi AI:

  • listini riservati e offerte non pubbliche;
  • documenti destinati a clienti, prospect o partner;
  • procedure operative;
  • dati personali, finanziari o contrattuali;
  • dashboard;
  • ambienti di staging e test;
  • documentazione tecnica proprietaria;
  • login e back-office;
  • flussi di pagamento;
  • API private.

Questi contenuti non devono dipendere da robots.txt o da una semplice policy verso i crawler per restare protetti.

La protezione deve avvenire a livello applicativo e server-side attraverso autenticazione, autorizzazioni, firewall, WAF, rate limiting e altri controlli di sicurezza.