Pourquoi ChatGPT cite des sources américaines pour des requêtes canadiennes
Demandez à un moteur génératif de recommander un prestataire à Montréal ou à Toronto, puis regardez ce qu’il nomme. La plupart du temps, les sources sont américaines. Ce n’est pas un biais et ça ne dit rien de votre contenu — c’est de la résolution d’entité, et ça se corrige.
Ce que vous en retirerez
- Les moteurs génératifs ne classent pas des pages ; ils composent des réponses à partir de sources qu’ils savent identifier. Être inidentifiable est un échec différent de mal se positionner.
- Quatre mécanismes poussent les modèles vers les sources américaines : le volume du corpus, les entités non résolues, l’absence de corroboration, et un moteur de récupération qui a sa propre géographie.
- Le Canada ajoute un cinquième problème : deux langues, et des provinces dont le nom désigne aussi une ville.
- Le correctif technique (accès des robots, données structurées, hreflang, format des réponses) prend environ une journée.
- Ce qui décide vraiment du résultat — des sources indépendantes qui confirment votre entité — prend de trois à six mois.
Je fais ce test avec presque tous mes clients canadiens, et le résultat est assez constant pour que j’ouvre désormais mes mandats avec. Demandez à ChatGPT, à Perplexity ou au mode IA de Google de recommander un prestataire dans une ville canadienne, dans la catégorie du client. Puis lisez la liste des citations plutôt que la réponse. La plupart du temps, les sources nommées sont américaines : une publication professionnelle des États-Unis, un classement Forbes, un fil Reddit, Wikipédia. Parfois le moteur nomme des entreprises américaines comme options pour une requête explicitement canadienne.
Le réflexe est d’appeler ça un biais. Ça n’en est pas un, ou du moins pas d’une manière sur laquelle vous puissiez agir. C’est une conséquence mécanique de la façon dont ces systèmes résolvent l’identité des choses — et contrairement à un biais, une mécanique, ça se travaille.
Le sujet pèse plus lourd chaque trimestre. Le rapport Tendances Internet canadien 2026 de l’ACEI établit que 46 % des Canadiens ont utilisé un outil d’IA générative au cours de l’année écoulée, contre 33 % en 2025 et 16 % en 2024, et que 52 % de ces utilisateurs s’en sont servis comme moteur de recherche. Seuls 19 % disent toujours vérifier une réponse d’IA auprès d’une autre source.1 Pour une part croissante de votre marché, la réponse de l’IA est la phase de recherche. Si vous n’y êtes pas, vous n’êtes pas sur la liste.
1. Faites le test vous-même
Ne me croyez pas sur parole. Ça prend trois minutes, et c’est la seule façon de savoir où vous en êtes plutôt que où en est le marché.
- Ouvrez ChatGPT avec la recherche web active, en session déconnectée ou en conversation temporaire, pour que votre historique ne colore pas le résultat.
- Posez la question qu’un acheteur taperait vraiment : pas « qui est Hicham Souilmi » mais « j’ai besoin d’un consultant SEO pour un site bilingue à Montréal — à qui parler ? »
- Notez si vous êtes nommé, et relevez chaque domaine cité.
- Reposez la même question dans l’autre langue officielle.
- Recommencez le tout dans Perplexity et dans le mode IA de Google.
Consignez les résultats dans un tableau comme celui-ci, et gardez-le. Rejouez-le chaque mois : la valeur est dans la tendance, pas dans l’instantané.
| Requête | Moteur | Langue | Nommé ? | Sources citées |
|---|---|---|---|---|
| Intention d’achat, votre ville | ChatGPT | FR | Non | 2 × sources hexagonales |
| Intention d’achat, votre ville | ChatGPT | EN | Non | 3 × US, 1 × global |
| Question de définition | Perplexity | FR | Non | Reddit, blogue US |
| « Meilleur X au Québec » | Mode IA Google | FR | Oui | Votre site + annuaire |
Le diagnostic en trois minutes
Posez la même question en français et en anglais. L’écart entre les deux réponses vous dit où se situe votre problème d’entité. Si vous apparaissez dans une langue et disparaissez dans l’autre, le problème est le ciblage linguistique. Si vous disparaissez dans les deux, c’est la corroboration.
2. Ce que disent réellement les données de citation
Deux résultats de recherche publiés expliquent l’essentiel de ce que vous verrez dans ce tableau.
Les citations IA ne sont pas vos positions Google. La comparaison menée par Semrush entre le mode IA de Google et la recherche classique montre des degrés de recouvrement très différents selon la surface : les AI Overviews s’appuyaient encore largement sur l’index classique, avec environ 86 % de recouvrement au niveau des domaines et 67 % au niveau des URL avec le top 10 organique, tandis que le mode IA descendait autour de 54 % et 35 %. ChatGPT présentait le plus faible recouvrement avec le top 10 de Google de toutes les surfaces testées, ce qui concorde avec sa dépendance à un autre moteur de récupération.2 La lecture pratique : être premier sur Google vous donne une bonne chance d’AI Overview et très peu de levier dans ChatGPT.
Les modifications au niveau du contenu déplacent mesurablement la visibilité générative. L’article de KDD 2024 qui a nommé le domaine, GEO: Generative Engine Optimization, a mené des tests contrôlés sur un large corpus de requêtes et constaté que des modifications précises — ajouter des citations, ajouter des statistiques citables, resserrer les affirmations — produisaient des gains significatifs sur la fréquence à laquelle une source apparaissait dans les réponses générées, avec des effets très variables selon le domaine.3 C’est le point que l’on manque le plus souvent : la visibilité générative répond à la façon dont une page formule les choses, pas seulement à son existence.
Sous ces deux résultats se trouve une tendance comportementale bien documentée. Une étude EMNLP 2024 sur le biais de marque dans les LLM a montré que les modèles associent systématiquement les marques mondiales à des attributs positifs et les marques locales à des attributs négatifs — et, fait notable, qu’ils basculent vers les marques locales lorsque le pays est mentionné explicitement dans la requête.4 Le réglage par défaut penche vers le global. Un signal local explicite le ramène. Tout l’enjeu tient dans cette phrase.
3. Quatre raisons qui poussent un modèle vers une source américaine
Le volume du corpus
Le corpus américain anglophone écrase le corpus canadien, et le corpus français de France écrase le corpus québécois. Quand un modèle n’a aucune raison forte de préférer une source locale, c’est la densité qui tranche. C’est pourquoi une requête francophone depuis Montréal fait souvent remonter un cabinet parisien : le modèle ne choisit pas la France, il choisit le plus gros amas francophone dont il dispose.
Des entités non résolues
Un moteur génératif doit décider ce qu’est votre site avant de décider s’il peut le citer. Une page avec un numéro de téléphone en pied de page et « nous desservons la région de Montréal » dans le texte, c’est une page. Une entité, c’est une chose avec un type, un nom, un identifiant, une localisation et des confirmations. La plupart des sites de PME canadiennes sont des pages.
Aucune corroboration
C’est le facteur qui décide de tout. Si votre entreprise n’est décrite que sur votre propre site, le modèle dispose d’exactement un témoin — et ce témoin, c’est vous. Si le même nom, la même adresse et la même catégorie apparaissent sur LinkedIn, une fiche Google, un registre provincial, une association professionnelle et Wikidata, vous devenez un fait plutôt qu’une affirmation.
Le moteur de récupération a sa propre géographie
Les moteurs ne partagent pas d’index. La couche de recherche de ChatGPT, les surfaces IA de Google et le pipeline de Perplexity récupèrent différemment, et chacun hérite de la couverture géographique de ce qu’il interroge. Être fort sur l’un ne dit presque rien des autres — d’où la colonne « moteur » dans le panel ci-dessus.
4. La couche canadienne : deux langues, une province ambiguë
Les entreprises canadiennes portent deux difficultés supplémentaires que les entreprises américaines n’ont tout simplement pas.
La séparation bilingue. La plupart des sites canadiens soit mélangent
le français et l’anglais sur une même URL, soit font tourner deux versions sans aucune
relation formelle déclarée entre elles. Les deux laissent le modèle deviner. Sans
hreflang réciproque et sans identifiant d’entité partagé, vos pages
françaises et vos pages anglaises ressemblent à deux sites faibles sans lien plutôt
qu’à un seul site bilingue solide.
Des noms qui désignent deux choses. « Québec » est une province et une ville. « Ontario » est une province et une commune de Californie. « London » est en Ontario et en Angleterre. Un humain lève l’ambiguïté par le contexte ; un système de récupération la lève par des déclarations explicites, ou pas du tout. Si rien sur votre site n’indique la province sous forme lisible par machine, vous êtes en concurrence d’attention avec une ville californienne.
Un site que personne d’autre ne confirme n’est pas une entité pour un modèle. C’est une page parmi des milliards.
— Hicham Souilmi
5. Étape 1 — Assurez-vous d’être joignable
Avant tout raffinement, vérifiez la chose ennuyeuse. Une part non négligeable des sites
bloque les robots qui alimentent les réponses IA, et la plupart ne l’ont pas décidé : le
blocage vient d’un réglage par défaut de CDN, d’une extension de sécurité, ou d’un
robots.txt copié chez un éditeur de presse qui, lui, l’avait décidé.
Faites trois vérifications, dans cet ordre :
- Ouvrez
votredomaine.ca/robots.txtet cherchezGPTBot,OAI-SearchBot,ChatGPT-User,ClaudeBot,Claude-SearchBot,PerplexityBotetGoogle-Extended. - Contrôlez les règles de gestion de robots de votre CDN ou WAF. Cloudflare, en particulier, propose des réglages gérés qui bloquent les robots IA indépendamment de votre
robots.txt: le fichier peut donc sembler permissif pendant que le serveur de bordure refuse la requête. - Cherchez ces agents dans vos logs serveur sur les 30 derniers jours. Si un robot n’y apparaît jamais, c’est qu’il n’est jamais venu — quoi que dise le fichier.
Il faut savoir que ces robots font des métiers différents. OpenAI documente trois agents
distincts : GPTBot explore pour l’entraînement des modèles,
OAI-SearchBot construit l’index de recherche qui produit les citations, et
ChatGPT-User récupère une page en direct quand la question d’un utilisateur
l’exige.5 Bloquer les trois parce que vous ne voulez pas
entraîner le modèle de quelqu’un vous retire aussi des réponses. Si c’est l’arbitrage
que vous voulez, voici sa forme :
# Autoriser les robots qui peuvent vous citer. Refuser celui qui ne fait qu'entraîner.
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
Sitemap: https://www.votredomaine.ca/sitemap.xml
À faire en premier
Toutes les autres recommandations de cet article supposent que le robot atteint la page. S’il ne l’atteint pas, rien de ce qui suit ne compte. Cette vérification prend dix minutes.
6. Étape 2 — Déclarez une entité complète
Ici, le correctif n’est pas éditorial. C’est un problème de déclaration : énoncer, sous forme lisible par machine, exactement ce qu’un modèle devrait sinon déduire.
| Signal | Ce que ça corrige | Erreur fréquente |
|---|---|---|
areaServed |
Rattache votre service à une ville et une province nommées, plutôt qu’à une région vague | N’écrire que « Canada », donc concourir nationalement et ne gagner nulle part |
sameAs |
Affirme que vos profils et votre site sont la même entité | Le traiter comme un widget de liens sociaux plutôt qu’une affirmation d’identité |
hreflang |
Sépare vos marchés français et anglais au lieu de les faire concourir | Balises non réciproques, ou fr au lieu de fr-CA |
@id unique |
Empêche vos pages de déclarer des entités contradictoires | Copier un même bloc JSON-LD sur toutes les pages sans le modifier |
Voici la forme que ça prend. areaServed et sameAs sont des
propriétés standard de schema.org, et Google documente les types qu’il consomme
réellement pour ses résultats enrichis — mais les données structurées sont lues par bien
plus de systèmes que ceux de Google.6
{
"@context": "https://schema.org",
"@type": "ProfessionalService",
"@id": "https://www.votredomaine.ca/#organization",
"name": "Votre Entreprise inc.",
"url": "https://www.votredomaine.ca/",
"inLanguage": ["fr-CA", "en-CA"],
"address": {
"@type": "PostalAddress",
"streetAddress": "123 rue Sainte-Catherine O",
"addressLocality": "Montréal",
"addressRegion": "QC",
"postalCode": "H3B 1A1",
"addressCountry": "CA"
},
"areaServed": [
{ "@type": "City", "name": "Montréal" },
{ "@type": "AdministrativeArea", "name": "Québec" },
{ "@type": "Country", "name": "Canada" }
],
"sameAs": [
"https://www.linkedin.com/company/votre-entreprise",
"https://www.wikidata.org/wiki/QXXXXXXX",
"https://www.crunchbase.com/organization/votre-entreprise"
]
}
Deux règles que l’on enfreint sans arrêt. D’abord, un seul @id par
entité, réutilisé partout où cette entité est référencée — pas un par page.
Votre organisation est la même organisation sur chaque URL ; dites-le. Ensuite, les
valeurs de sameAs doivent être des comptes qui confirment réellement les
informations déclarées. Une page LinkedIn indiquant une autre ville affaiblit
l’affirmation au lieu de l’appuyer.
Côté bilingue, déclarez la paire de façon réciproque sur les deux pages, et ajoutez un
x-default :
<link rel="alternate" hreflang="fr-CA" href="https://www.votredomaine.ca/fr/services.html">
<link rel="alternate" hreflang="en-CA" href="https://www.votredomaine.ca/services.html">
<link rel="alternate" hreflang="x-default" href="https://www.votredomaine.ca/services.html">
Vous ne savez pas à quoi ressemble votre entité vue de l’extérieur ?
Trente minutes pour tester votre marque dans ChatGPT, Perplexity et l’IA de Google, et voir précisément quels signaux manquent. Sans engagement, sans présentation.
Réserver un appel7. Étape 3 — Écrivez des réponses qu’un modèle peut extraire
Les moteurs génératifs réutilisent volontiers les structures question-réponse, parce que l’étape de récupération cherche un passage qui résout une requête. La règle pratique : posez la question dans un titre, puis répondez-y en une phrase autonome, avant de développer.
« Autonome » est la partie difficile. Une phrase qui commence par « cette approche fonctionne aussi pour… » ne sert à rien une fois extraite de son paragraphe. L’unité extraite doit survivre sans le contexte qui l’entoure.
Ne survit pas à l’extraction
« Ça prend généralement à peu près ce temps-là, selon votre situation et les facteurs évoqués plus haut. »
Survit à l’extraction
« Au Canada, corriger l’entité d’un site bilingue demande environ une journée de travail technique et de trois à six mois de corroboration avant que les citations changent. »
Au-delà de ça, trois formats rendent plus qu’ils ne coûtent :
- Les définitions. Une phrase, commençant par le terme lui-même, avant toute nuance.
- Les tableaux comparatifs. Structurés, étiquetés, lisibles sans le texte autour.
- Les procédures numérotées. Des étapes qui nomment chacune une action concrète plutôt qu’un principe.
Et nommez-vous explicitement. Écrivez « Montréal, Québec » plutôt que « ici » ou « la ville ». Écrivez la province. Écrivez le pays au moins une fois sur toute page visant un marché local. Ça paraît légèrement redondant à un humain et ça supprime une catégorie entière d’ambiguïté pour une machine.
8. Étape 4 — Faites-vous corroborer
Tout ce qui précède prend une journée. Ceci prend des mois, et c’est ce qui décide du résultat. Une entité confirmée par trois ou quatre sources indépendantes pèse plus lourd que dix pages bien optimisées sur votre propre domaine.
Les surfaces canadiennes qui valent l’effort, grosso modo par rendement décroissant :
- La fiche Google Business, avec l’adresse, les catégories et les zones desservies exactement identiques à votre balisage — même orthographe, mêmes accents.
- La page entreprise et le profil personnel LinkedIn, indiquant tous deux la même localisation et la même catégorie. LinkedIn figure parmi les sources les plus citées par les surfaces IA en contexte B2B.
- Les registres provinciaux et fédéraux — le Registraire des entreprises du Québec, le registre des entreprises de l’Ontario, Corporations Canada. Ce sont des sources de haute confiance, lisibles par machine et permanentes.
- Une association ou un ordre professionnel disposant d’un annuaire public de membres.
- Wikidata, si votre organisation répond réellement aux critères de notoriété. Ne forcez pas ; un élément rejeté vaut moins que pas d’élément du tout. Wikidata est un carrefour d’identité structuré que beaucoup de systèmes consultent.
- De vraies mentions dans la presse ou les balados canadiens. Un article dans une véritable publication professionnelle vaut mieux que vingt inscriptions en annuaire.
La cohérence compte plus que le volume. Quatre sources d’accord sur votre nom, votre adresse et votre catégorie font davantage que douze sources en désaccord. Avant d’ajouter une cinquième inscription, auditez les quatre que vous avez.
9. Comment savoir si ça a marché
Trois mesures, mensuelles, dans cet ordre :
| Quoi | Où | Ce que ça vous dit |
|---|---|---|
| Visites des robots IA | Logs serveur, filtrés par agent | Si vous êtes joignable — la couche d’accès |
| Sessions de référence | Analytique, hôtes comme chatgpt.com, perplexity.ai |
Si les citations génèrent de vraies visites |
| Résultats du panel de requêtes | Votre propre tableur, ~20 requêtes, deux langues | Si vous êtes nommé, et qui l’est à votre place |
La troisième est la seule vraie mesure de progression en GEO, et il n’y a pas de raccourci. Les réponses génératives varient d’une exécution à l’autre : un test isolé ne prouve rien, alors qu’un panel fixe rejoué à la même date chaque mois, dans les deux langues, produit une tendance exploitable. Gardez les mêmes requêtes même quand vous serez tenté de les améliorer — changer l’instrument invalide la série.
10. Ce qui ne marche pas
- « llms.txt » comme substitut au vrai travail. La proposition est intéressante, mais aucun grand moteur ne s’est engagé à le consommer comme signal de classement ou de citation. Publiez-le si vous voulez ; ne comptez pas dessus.
- Publier plus, plus vite. Le volume était une stratégie faible en SEO ; c’en est une pire ici. La citation va aux passages qui résolvent proprement une question, pas aux domaines qui ont le plus d’URL.
- Truffer ses pages de mentions de marque. Répéter sur son propre domaine ne crée pas de corroboration. Ça reste un seul témoin, qui dit la même chose plus fort.
- Acheter des inscriptions en annuaire en masse. Des inscriptions incohérentes nuisent activement, parce qu’elles introduisent des faits contradictoires sur l’entité que vous essayez de rendre non ambiguë.
- Traiter le GEO comme une discipline séparée avec du contenu séparé. C’est le même contenu, rendu assez explicite pour être extrait.
11. Un plan sur 30 jours
- Semaine 1 — Diagnostiquer. Construisez le panel de requêtes, jouez-le dans les deux langues sur trois moteurs, consignez la ligne de base. Auditez
robots.txtet les règles de robots du CDN. Cherchez les agents IA dans 30 jours de logs. - Semaine 2 — Déclarer. Livrez le balisage d’entité avec un
@idunique, unareaServedcomplet, une vraie adresse postale, et unsameAsne pointant que vers des profils que vous contrôlez et avez vérifiés. Corrigez le hreflang de façon réciproque. - Semaine 3 — Réécrire. Prenez vos cinq pages à plus forte intention. Ajoutez à chaque section un titre sous forme de question et une réponse en une phrase. Ajoutez un tableau comparatif. Nommez explicitement la ville, la province et le pays.
- Semaine 4 — Corroborer. Alignez la fiche Google, LinkedIn et votre inscription au registre pour que les trois correspondent à votre balisage, caractère pour caractère. Identifiez deux cibles réalistes de presse ou d’association et lancez l’approche.
Ensuite, attendez, et rejouez le panel le même jour le mois suivant. Le travail technique se voit en quelques semaines. Le travail de corroboration se voit entre le troisième et le sixième mois — raison pour laquelle ceux qui commencent maintenant seront ceux qu’on citera quand ça comptera.
Les questions qu’on me pose
Pourquoi ChatGPT recommande-t-il des entreprises américaines pour des recherches canadiennes ?
Parce qu’il arrive à résoudre l’entreprise américaine comme entité et qu’il n’y arrive généralement pas avec la vôtre. Un moteur génératif ne classe pas des pages — il compose une réponse à partir de sources qu’il sait identifier. Les entreprises américaines sont décrites par bien plus de sources concordantes, donc elles se résolvent proprement. Si rien en dehors de votre site ne confirme qui vous êtes, où vous opérez et ce que vous faites, le modèle a une page mais pas d’entité, et il retombe sur le corpus qu’il connaît.
Un domaine .ca aide-t-il à être cité par les IA ?
Un peu, et jamais seul. Un domaine .ca est un indice géographique
faible. Des données structurées explicites — areaServed nommant la
ville et la province, une vraie adresse postale, et des liens sameAs
vers des profils qui confirment les mêmes informations — pèsent bien plus lourd, et
fonctionnent aussi bien sur un .com.
Si je bloque GPTBot, puis-je quand même apparaître dans ChatGPT ?
Pas de façon fiable. OpenAI exploite des robots distincts pour des tâches
distinctes : GPTBot pour l’entraînement, OAI-SearchBot
pour l’index de recherche qui produit les citations, et ChatGPT-User
pour les récupérations en direct déclenchées par un utilisateur. Pour être cité
sans alimenter l’entraînement, autorisez les deux derniers et refusez le premier.
Tout bloquer vous retire de la réponse.
Combien de temps avant d’être cité ?
La couche technique — accès des robots, données structurées, hreflang, format des réponses — se livre en une journée et remonte en quelques semaines. La corroboration prend de trois à six mois. C’est cette seconde partie qui décide du résultat, et c’est pourquoi la réponse honnête à « combien de temps » est « commencez maintenant ».
Faut-il des pages séparées pour le français et l’anglais ?
Oui. Des URL distinctes, un hreflang réciproque pour
fr-CA et en-CA, plus un x-default. Une page
unique mélangeant les deux langues envoie des signaux contradictoires et vous rend
généralement invisible dans les deux marchés plutôt que visible dans un seul.
Le GEO est-il vraiment différent du SEO ?
C’est la même discipline visant un second public. Les fondations sont identiques : accessibilité aux robots, structure, clarté, autorité. Ce qui change, c’est l’unité de succès — une phrase citée plutôt qu’une page positionnée — et le poids de la clarté d’entité et de la corroboration externe par rapport aux facteurs de classement classiques. Quiconque vous vend le GEO comme une discipline entièrement neuve vous vend un changement de nom.
Faut-il un outil payant de suivi GEO ?
Pas pour commencer. Un tableur de vingt requêtes rejoué chaque mois dans les deux langues vous en dit plus que la plupart des tableaux de bord, parce que vous choisissez des requêtes que vos acheteurs taperaient vraiment. Envisagez un outil quand vous suivrez plus de marques ou de marchés qu’un tableur ne peut en contenir.
Sources
- ACEI (CIRA), Tendances Internet canadien 2026, juillet 2026 — adoption de l’IA générative, usage comme moteur de recherche, habitudes de vérification. cira.ca
- Semrush, How Google’s AI Mode Compares to Traditional Search and Other LLMs — recouvrement des domaines et des URL entre les surfaces IA et le top 10 organique de Google. semrush.com
- Aggarwal, Murahari, Rajpurohit, Kalyan, Narasimhan et Deshpande, GEO: Generative Engine Optimization, KDD ’24, ACM. doi.org/10.1145/3637528.3671900
- « Global is Good, Local is Bad? »: Understanding Brand Bias in LLMs, EMNLP 2024 — association marques mondiales/locales et effet du pays d’origine. arxiv.org/abs/2406.13997
- OpenAI, Bots — documentation de GPTBot, OAI-SearchBot et ChatGPT-User. platform.openai.com/docs/bots
- schema.org, areaServed et sameAs ; Google Search Central, documentation sur les données structurées.
Là où cet article décrit des tendances sans citation, il s’appuie sur mes propres tests avec des clients canadiens plutôt que sur de la recherche publiée. Rejouez le protocole de la section 1 et jugez par vous-même.