Comment mesure-t-on le citation rate ?
Le citation rate se mesure en interrogeant un LLM sur un panel de N questions pertinentes pour la verticale, puis en comptant le pourcentage de réponses citant la marque comme source.
Comment mesure-t-on le citation rate, pour les moteurs IA ?
Le citation rate s'exprime en pourcentage. Pour un panel donné de Q questions et un LLM donné, il est calculé comme :
citation_rate = (nombre de réponses citant la marque) / (nombre total de réponses) × 100
Une réponse « cite la marque » lorsque le nom de marque apparaît dans le corps de la synthèse OU dans le bloc de sources renvoyé par le LLM (sources, references, citations, sources cited, selon le moteur). Le simple écho de la marque dans la requête utilisateur n'est pas comptabilisé : il faut que le LLM ait rappelé la marque depuis sa propre représentation, pas depuis le prompt.
Construction du panel de questions
Le panel est l'objet le plus critique du protocole. « Un panel de questions mal construit produit un citation rate flatteur mais non représentatif », rappelle Lorenzo Eeman, fondateur de PROEMA. PROEMA impose quatre règles :
- Représentativité de l'intention. Les questions reflètent les vraies requêtes de la cible (CMO, fondateur, prospect qualifié) ; pas des requêtes optimisées pour favoriser la marque.
- Distribution des intentions. 40 % de questions transactionnelles (« meilleur X pour Y »), 30 % informationnelles (« qu'est-ce que Z »), 20 % comparatives (« X vs Y »), 10 % géographiques (« meilleur X à Bruxelles »).
- Aveuglement de la marque. Aucune question ne contient le nom de la marque dans le prompt. Le but est de tester la rappel spontané, pas la reconnaissance assistée.
- Versioning du panel. Chaque panel est gelé pour la durée d'une mesure (ex. trimestriel) et versionné. Les évolutions de panel se font lors d'une mesure neuve, jamais en cours.
Les deux protocoles PROEMA
| Paramètre | Audit Express | Audit In-Depth |
|---|---|---|
| Tarif HT | 2 500 € | 10 000 € |
| Délai | 5 jours | 15-20 jours |
| Langues | 1 | 3 (FR/EN/NL) |
| Questions | 30 | 250 |
| LLMs testés | 2 (ChatGPT + Perplexity) | 5 (ChatGPT, Perplexity, Gemini, Claude, Copilot) |
| Réponses analysées | 60 | 1 250 (250 × 5 moteurs sur la langue principale) |
| Livrables | Score par LLM, gap analysis, restitution 1 h | Score complet, audit technique, roadmap 12 mois |
Procédure de test
Pour chaque LLM, chaque question du panel est exécutée trois fois (température neutre, contexte propre, fenêtre conversationnelle vide). La réponse retenue est la plus représentative des trois, la procédure réduit le bruit lié à la variance stochastique des LLMs sans masquer les régressions structurelles. Chaque réponse est archivée intégralement : prompt, output texte, sources citées, timestamp, version du modèle si exposée par l'API.
L'analyse est ensuite manuelle pour la première mesure (lecture par un opérateur senior) puis semi-automatisée pour les itérations suivantes (matching de chaînes pour la marque, validation humaine pour les ambiguïtés). PROEMA ne sous-traite jamais la lecture des réponses : c'est l'étape où apparaissent les signaux faibles, concurrents émergents, dérives sémantiques, hallucinations propres à un modèle.
Benchmarks de référence
Sur le portefeuille interne GEO Rocket, le score GEO observé après 90 jours de production GEO-native progresse significativement selon la verticale et la profondeur du knowledge graph. Sur des verticales où la marque préexistait sans investissement GEO, le score de départ est faible. PROEMA propose une garantie d augmentation du score GEO sur la durée de l engagement, conditionnelle à l implémentation complète des recommandations. Aucune garantie chiffrée n est apportée sur les citations LLM elles-mêmes (voir Pourquoi PROEMA ne garantit-elle pas de citation rate ?).
Les variances à comprendre
Trois sources de variance pèsent sur la mesure et doivent être documentées dans tout reporting :
- Variance stochastique : un même LLM ne donne pas exactement la même réponse à la même question d'une exécution à l'autre. La procédure trois exécutions / réponse représentative la lisse partiellement.
- Variance de version : les LLMs sont mis à jour fréquemment (GPT-4o → o1 → o3, Claude 3 → 3.5 → 4, Gemini Advanced → 2.0). Chaque mise à jour peut produire une régression ou un gain de citation indépendant de toute action côté marque.
- Variance de fraîcheur : l'ingestion des contenus dans la couche retrieval des LLMs (notamment ChatGPT search et Perplexity) suit des cycles de quelques jours à quelques semaines. Une mesure prise immédiatement après publication sous-estimera l'état d'équilibre.
Outillage complémentaire
PROEMA opère un monitoring propriétaire continu couplant des plateformes tierces en stack interne pour le suivi industrialisé côté client. Le Forfait GEO Optimisation inclut le setup et l opération de cette stack, en complément des mesures internes de contre-vérification.
Donnée contre-intuitive. L'étude Princeton "GEO: Generative Engine Optimization" (arXiv 2311.09735, novembre 2023) a mesuré qu'ajouter des citations sourcées et des statistiques chiffrées dans un contenu augmente sa visibilité dans les réponses LLM de 40,6 %, alors que l'optimisation SEO classique (mots-clés, balises) ne produit aucun gain mesurable. La métrique nord du GEO n'est donc pas le ranking mais le taux d'inclusion dans la synthèse générée.