[ Protocollo ]
Come misurare la visibilità nei motori generativi
[ In breve ]
La visibilità AI non è un ranking stabile. Si osservano presenza, posizione, fonti e sostituzioni su un set dichiarato di domande, superfici e condizioni. Ogni frequenza va accompagnata da numero di esecuzioni e incertezza; il confronto nel tempo usa lo stesso disegno e descrive un cambiamento osservato, non una causalità dimostrata.
- Pubblicato
- Lettura
- 8 min
Perché la stessa domanda dà risposte diverse?
Perché un modello generativo campiona. A parità di input la formulazione cambia, e quando il sistema recupera documenti dal web anche l'insieme dei documenti recuperati può cambiare: dipende dall'indice in quel momento, dalla riscrittura interna della query, dal mercato da cui arriva la richiesta. Aggiungi la personalizzazione, la cronologia dell'account e la memoria, e due persone che scrivono la stessa frase possono leggere due risposte diverse.
Questa è la ragione per cui uno screenshot non è una misurazione. Uno screenshot dimostra che una risposta è esistita una volta, per qualcuno, in condizioni non dichiarate. Non dice quanto sia probabile che si ripeta, e non è confrontabile con niente.
La variabilità non rende però l'osservazione inutile. Impedisce di trattare una singola risposta come uno stato stabile. Quello che si può stimare è una frequenza sotto condizioni dichiarate, accompagnata dal numero di esecuzioni e dalla sua incertezza. Senza questi elementi, la percentuale appare più precisa di quanto sia.
Che cosa si può misurare in modo ripetibile?
Quattro cose, e conviene tenerle separate perché rispondono a domande diverse e si correggono con lavori diversi.
- Presenza: il brand compare nella risposta, sì o no. È il dato più grezzo e il più facile da comunicare.
- Posizione nella risposta: compare come prima opzione, in un elenco di alternative, o in una nota finale. Cambia molto l'effetto pratico.
- Fonti recuperate: quali URL la risposta ha usato. È il dato più operativo, perché indica dove intervenire.
- Sostituzioni: chi viene raccomandato quando tu non compari. È il dato che rende la misurazione discutibile in una riunione commerciale.
Come si costruisce il set di domande?
Non con le keyword. Le keyword sono frammenti; qui servono domande complete, scritte come le scriverebbe una persona che sta decidendo. La differenza pratica è che una keyword produce una risposta generica, mentre una domanda con contesto produce la risposta che il cliente vedrà davvero.
Il set va costruito per intento, coprendo l'intero percorso decisionale. Scoperta: chi risolve questo problema. Confronto: quale tra questi due. Selezione fornitore: a chi mi rivolgo se ho questo vincolo. Obiezione: quali sono i limiti di questo approccio. Verifica: questa azienda è affidabile. Ogni intento produce risposte strutturalmente diverse, e un set che copre solo la scoperta racconta un quinto della storia.
Poi vanno dichiarati mercato e lingua, perché sono variabili che cambiano il risultato più di quasi tutto il resto. La stessa domanda in italiano e in inglese non recupera le stesse fonti. Misurare in inglese un business che vende in Italia produce un numero elegante e inutile.
Non esiste un numero universale di domande. La dimensione dipende da cosa vuoi stimare, da quanti intenti e mercati devi coprire, dalla variabilità osservata e dal costo delle ripetizioni. Il set va stratificato per intento e dimensionato prima sul confronto futuro: una baseline ampia che non può essere ripetuta non produce una misura utile.
Quante esecuzioni servono per domanda?
Più di una, con lo stesso disegno per le righe che vuoi confrontare. Un'esecuzione singola è un'osservazione. Le ripetizioni consentono di stimare una frequenza, ma non diventano automaticamente indipendenti: modello, indice, query fan-out e documenti recuperati possono introdurre dipendenze che il report deve riconoscere.
Cinque esecuzioni possono bastare per un'esplorazione, non per stimare con precisione una probabilità. Il numero va scelto in base alla risoluzione necessaria, alla variabilità iniziale e alla differenza minima che avrebbe valore decisionale. Intervalli binomiali o bayesiani rendono visibile l'incertezza; aumentare le esecuzioni la restringe, non la elimina.
Le condizioni di sessione vanno definite e ripetute. Una sessione senza memoria riduce alcune fonti di variazione, ma non simula l'esperienza personalizzata dell'utente. Quando il caso lo richiede, conviene separare un campione controllato da uno realistico, senza mescolare i due risultati.
Che cosa si registra a ogni esecuzione?
Il minimo per rendere la riga ricostruibile da un'altra persona sei mesi dopo. Se un campo manca, quella riga non è confrontabile e va scartata invece che interpretata.
| Campo | Perché serve |
|---|---|
| Domanda testuale | Consente di ripetere la misurazione parola per parola |
| Motore e data | Le funzionalità e gli indici cambiano nel tempo |
| Superficie e modalità | Interfaccia, API, ricerca web e modalità conversazionale non sono equivalenti |
| Versione o identificatore disponibile | Riduce l'ambiguità quando modelli e prodotti cambiano |
| Mercato e lingua | Cambiano le fonti recuperate più di qualsiasi altra variabile |
| Ora e condizione di sessione | Rende espliciti contesto, memoria e possibili effetti temporali |
| Numero dell'esecuzione | Distingue la frequenza dal caso singolo |
| Brand citato, sì o no | Il dato di presenza |
| Posizione nella risposta | Prima opzione, alternativa, nota marginale |
| Fonti recuperate | Indica su cosa lavorare, ed è il campo più trascurato |
| Competitor citati | Mostra chi occupa lo spazio quando non lo occupi tu |
| Risposta integrale | Permette di rileggere il contesto senza rifare il test |
Come si confronta una nuova misurazione con la baseline?
Usando lo stesso protocollo dichiarato e documentando ciò che non può restare fisso. Domande, numero di esecuzioni, mercato, lingua e condizioni di sessione restano confrontabili dove possibile; aggiornamenti di motori e superfici vengono annotati. Se cambia la formulazione di una domanda, quella riga esce dal confronto storico e diventa un campione esplorativo separato.
Il confronto restituisce categorie da comunicare separatamente invece di comprimerle in un indice unico. Guadagni: domande dove prima non comparivi e ora compari. Perdite: il contrario, da investigare senza attribuire automaticamente una causa tecnica o competitiva. Nuovi ingressi: competitor che prima non c'erano e ora occupano lo spazio osservato.
Sul rapporto tra intervento e risultato serve onestà. Tra una baseline e una ri-misurazione cambiano molte cose che non controlli: i modelli vengono aggiornati, gli indici si muovono, i competitor pubblicano. Il confronto mostra che la posizione osservata si è spostata, nella direzione attesa o no. Non dimostra che si è spostata a causa tua. Chi presenta il secondo come dimostrato sta esagerando, e prima o poi qualcuno lo verifica.
Quanto deve cambiare un dato perché conti?
Questa è la domanda che manca in quasi tutti i report. Dire di confrontare guadagni e perdite serve a poco se non si dichiara quale ampiezza si considera un segnale, perché senza quella soglia ogni oscillazione può diventare una storia conveniente.
Il punto di partenza è aritmetico. Con cinque esecuzioni per domanda la risoluzione è di un quinto: il cambiamento più piccolo osservabile è di venti punti. Questo non autorizza però una soglia universale. Passare da due su cinque a tre su cinque è compatibile con molta incertezza e va descritto come osservazione esplorativa.
Prima di raccogliere i dati bisogna dichiarare la differenza minima che cambierebbe una decisione e scegliere un disegno capace di rilevarla. Per una singola domanda si riportano conteggi e intervalli. A livello di set si preservano gli strati per intento e si può usare un confronto appaiato o un bootstrap, senza assumere che domande scelte intenzionalmente rappresentino un universo.
La ragione per cui la soglia va dichiarata prima è meno tecnica e più scomoda: decidere cosa conta dopo aver visto i numeri è il modo in cui si trova sempre quello che si spera di trovare. Scriverla nel protocollo prima del primo ciclo costa niente e rende il secondo ciclo discutibile da chiunque.
Una domanda che oscilla tra due su cinque e tre su cinque non dimostra un miglioramento o un peggioramento. Documenta un comportamento instabile nelle condizioni osservate e segnala che servono più dati, un periodo diverso o una domanda meglio definita.
Ogni quanto conviene ri-misurare?
Novanta giorni può essere un intervallo pratico quando il cambiamento richiede pubblicazione, indicizzazione e diffusione. Non è una soglia universale: mercato, motore, tipo di intervento e dimensione del set cambiano ciò che è osservabile. Ri-misurare prima ha senso solo se una condizione dichiarata è cambiata davvero.
Il costo della ri-misurazione è prevedibile e vale conoscerlo prima di dimensionare il set: cresce come domande per esecuzioni per motori. Sessanta domande, cinque esecuzioni, quattro motori fanno milleduecento interrogazioni. Duplica una qualsiasi delle tre variabili e raddoppi il costo di ogni ciclo futuro, non solo del primo.
Da qui la conseguenza pratica: un set più grande non è automaticamente più accurato. Se riduce il numero di ripetizioni, rompe gli strati o impedisce il secondo ciclo, può produrre più righe ma meno informazione decisionale. La dimensione va scelta sul budget dell'intero disegno, non sul volume del primo report.
- Definire l'intervallo di ri-misurazione prima del lavoro, in base al cambiamento osservato e alle condizioni del set.
- Fuori ciclo, solo quando cambia qualcosa di sostanziale: un lancio, un riposizionamento, la pubblicazione di un contenuto pensato per una domanda specifica.
- Dimensiona il set sul costo del secondo ciclo, non del primo. È il secondo che genera il valore.
- Se il budget impone una riduzione, proteggi gli intenti essenziali e la comparabilità. Il compromesso tra domande, ripetizioni e motori va motivato, non automatizzato.
Come si contesta un risultato?
Questa è la domanda che distingue un'analisi da un'affermazione, e vale la pena farla a chiunque ti venda una misurazione. Se la risposta è che il dato non si può verificare, quello che hai comprato non è una misurazione.
Un risultato contestabile ha bisogno di pochi elementi, tutti nel report: domanda integrale, motore, data, mercato, lingua e numero di esecuzioni. Quei campi permettono di ripetere il protocollo dichiarato e valutare la nuova osservazione, riconoscendo che motori e recupero delle fonti possono essere cambiati.
Il criterio per giudicare la contestazione è la sistematicità, non la singola esecuzione. Se rifai la domanda una volta e ottieni un risultato diverso, non hai smentito niente: hai osservato la variabilità che il metodo dà per assunta. Se la ottieni in modo ripetuto e nella stessa direzione, allora una condizione è cambiata o era mal dichiarata, e in entrambi i casi la riga va corretta.
Chi produce l'analisi dovrebbe volere quelle contestazioni. Sono il modo in cui una baseline resta affidabile nel tempo invece di diventare un documento che nessuno controlla più.
Che cosa questa misurazione non dimostra?
Non dimostra il fatturato. Misura una presenza in una risposta, che sta molto a monte di una vendita. Collegare i due punti richiede altri dati, e presentare la presenza come ricavo è il modo più rapido per perdere credibilità al primo controllo.
Non dimostra causalità, per la ragione detta sopra. Mostra un movimento su condizioni dichiarate.
Non dimostra che l'utente reale vede la stessa cosa. Le sessioni pulite servono alla riproducibilità, non a simulare l'esperienza personalizzata. È una scelta consapevole: si preferisce un numero confrontabile a un numero realistico ma irripetibile.
Non è un campione statisticamente rappresentativo. Il set di domande è scelto intenzionalmente, per coprire gli intenti che contano commercialmente, non estratto a caso da una popolazione. Questo lo rende utile per decidere e inadatto a essere presentato come stima di un universo.
Non dimostra la copertura totale. Misura le domande che hai scelto. Se il set è costruito male, il risultato è coerente e inutile allo stesso tempo. La qualità del set di domande è il punto più fragile di tutto il processo, ed è il primo che chiederei di vedere se stessi comprando un'analisi.
[ Cosa portarsi via ]
- Ripeti ogni domanda più volte e registra una frequenza. Un'esecuzione singola è un'osservazione, non una tendenza.
- Dichiara sempre mercato, lingua, motori, data e condizioni di sessione. Senza quei campi il confronto non esiste.
- Registra le fonti recuperate. È il campo che dice dove intervenire, ed è quello che manca in quasi tutti i report.
- Comunica guadagni, perdite e nuovi ingressi separati. Un indice unico nasconde esattamente le informazioni utili.
- Non attribuire i movimenti al tuo intervento. Mostra il movimento e dichiara i limiti.
[ Servizio collegato ]
[ confronti nel tempo ]
Scopri AI Visibility Monitor[ Letture collegate ]
[ Fonti ]
[ Autore ]
Nicola Dussin
Fondatore di Creaitivo. Ogni misurazione è eseguita direttamente da me.
Profilo completoCome viene letto il tuo brand?
Raccontami il mercato, le domande che contano e ciò che oggi non riesci a osservare. Entro 48 ore ti indico se serve una baseline, un intervento tecnico o un confronto nel tempo.