L’essentiel à retenir
- La structure HTML : un H1, des H2 en questions, des paragraphes courts, des tableaux avec en-têtes, des listes ; tout le texte dans le HTML, sans dépendre du JavaScript.
- Les données structurées : Article ou BlogPosting (auteur, dates), Organization ou LocalBusiness (entité), FAQPage (questions), BreadcrumbList, Person pour les auteurs.
- Les formats : HTML d’abord ; PDF et images pour les compléments seulement ; transcriptions pour l’audio et la vidéo.
- La vérification : code source, test des résultats enrichis, inspection d’URL, et un test de lecture dans Perplexity.
Un contenu bien rédigé pour les IA (voir structurer un contenu pour les LLM) doit être servi dans une page que les robots peuvent lire et interpréter. C’est la couche technique du GEO : hiérarchie HTML, données structurées, formats, rendu. Elle est partagée avec le SEO et se met en place une fois, au niveau des gabarits. Cet article liste ce qu’il faut poser, dans quel ordre, et comment vérifier.
La hiérarchie HTML
| Élément | Règle | Pourquoi pour les IA |
|---|---|---|
| Titre de page (title) | Le sujet en moins de 60 caractères | Nom de la source dans la citation |
| H1 | Un seul, le sujet ou la question principale | Identifie la page |
| H2 et H3 | Une question ou un sous-sujet par titre, dans l’ordre | Découpage des passages |
| Paragraphes | Courts (3 à 5 phrases), un sujet chacun, dans des balises p | Unités d’extraction |
| Tableaux | table, thead, th, tbody ; jamais en image | Extraction cellule par cellule, comparaisons |
| Listes | ul et ol pour les étapes et les critères | Extraction ordonnée |
| Mise en évidence | strong pour le terme défini, pas pour décorer | Repère de définition |
| Liens | Ancres descriptives vers les pages liées | Contexte et crédibilité |
| Balises sémantiques | article, header, main, nav, footer, time | Distinguer le contenu du gabarit |
Les données structurées à poser
| Type Schema.org | Où | Propriétés clés | Effet |
|---|---|---|---|
| Organization ou LocalBusiness | Toutes les pages (ou l’accueil et « qui sommes-nous ») | name, url, logo, description, foundingDate, founder, address, sameAs, contactPoint | Entité reconnue et cohérente ; voir optimiser sa page « qui sommes-nous » |
| Article ou BlogPosting | Chaque article | headline, description, author (Person), datePublished, dateModified, publisher, image | Auteur et fraîcheur attribués |
| Person | Auteurs, fondateur | name, jobTitle, url, sameAs (LinkedIn), worksFor | Expertise identifiable |
| FAQPage | Pages avec FAQ | mainEntity : Question, acceptedAnswer | Questions et réponses lisibles ; extraits enrichis Google |
| BreadcrumbList | Toutes les pages | itemListElement | Position dans le site |
| HowTo | Procédures | step | Étapes extractibles |
| Product, Service, Offer | Pages produits et services | name, description, offers (price), aggregateRating | Prix et notes cités |
| VideoObject, PodcastEpisode | Pages vidéo et audio | transcript, duration, uploadDate | Contenu audiovisuel lisible ; voir référencer un podcast ou une vidéo |
Utilisez le format JSON-LD dans un script en tête ou en pied de page. Les données structurées n’obligent aucune IA à vous citer, mais Google et Bing les lisent, et leurs index alimentent les assistants ; elles fixent sans ambiguïté qui écrit, quand, et de quoi il s’agit. Le détail pour le local est dans les balises Schema.org pour le local.
La FAQ
- Trois à six questions réelles, formulées comme les utilisateurs les posent, en fin de page.
- Réponses de 40 à 70 mots, autonomes, avec le sujet nommé et un fait.
- Balisage FAQPage dont le texte correspond exactement au texte visible.
- Dans le HTML, même si l’affichage est en accordéon.
- Pas de doublon avec les sections : la FAQ traite les questions secondaires, les sections la question principale.
Les formats
| Format | Lisibilité par les IA | Usage recommandé |
|---|---|---|
| HTML | Excellente | Tout le contenu principal |
| Moyenne (indexé par Google, moins bien par les robots IA ; structure perdue) | Compléments téléchargeables, toujours doublés d’une page HTML | |
| Images (texte dans l’image, infographies) | Faible | Illustration ; le texte doit exister aussi en HTML, avec un alt |
| Vidéo, audio | Nulle sans transcription | Publier la transcription structurée |
| Contenu chargé en JavaScript | Faible (la plupart des robots IA n’exécutent pas le JavaScript) | Rendu serveur ou statique pour les pages clés |
| Markdown (llms.txt) | Bonne | Sommaire du site à la racine, en complément du sitemap |
Le rendu et l’accès
Trois conditions techniques : le contenu est dans le HTML servi (rendu serveur ou statique), les robots de recherche IA sont autorisés dans le robots.txt, et la page est rapide et disponible. Un site en rendu client (React, Vue sans SSR) est le cas le plus fréquent de contenu invisible pour les IA. La liste des robots et les réglages sont dans l’indexation par les IA.
Vérifier
- Code source (Ctrl+U) : le texte, les titres, les tableaux et la FAQ y figurent.
- Test des résultats enrichis de Google et validateur Schema.org : données structurées sans erreur.
- Inspection d’URL dans la Search Console : HTML rendu et capture conformes.
- Test de lecture : demander à Perplexity « résume la page [URL] et liste ses sections » ; une réponse fidèle prouve la lisibilité.
- Crawler (Screaming Frog) pour vérifier la hiérarchie des titres et les données structurées sur tout le site.
Comment GreenRed vous aide
Plutôt que de jongler entre plusieurs outils, le module Santé du site de GreenRed réunit ces indicateurs dans un seul tableau de bord, les compare dans le temps et vous indique les actions prioritaires. Vous pouvez le tester gratuitement, sans carte bancaire, depuis la page Tarifs.
Questions fréquentes
Les données structurées sont-elles lues par ChatGPT ?
Pas directement pour la plupart des assistants, mais Google et Bing les lisent et leurs index alimentent ChatGPT, Perplexity, Gemini et Copilot. Elles fixent l’auteur, la date, l’entité et les questions sans ambiguïté, ce qui pèse dans la sélection des sources. Elles sont aussi nécessaires aux extraits enrichis de Google.
Faut-il une FAQ sur chaque page ?
Sur les pages qui répondent à des questions (articles, guides, pages services), oui : trois à six questions réelles avec des réponses courtes et un balisage FAQPage. Sur les pages de navigation ou les fiches produits simples, une FAQ artificielle n’apporte rien.
Un PDF est-il lu par les IA ?
Google indexe les PDF et peut les citer dans les aperçus IA ; les robots des autres assistants les lisent moins bien et la structure (titres, tableaux) se perd. Publiez le contenu en HTML et proposez le PDF en complément téléchargeable, jamais l’inverse.
Mon site est en React : est-il visible pour les IA ?
Seulement si le contenu est rendu côté serveur ou pré-généré (SSR, SSG). En rendu client pur, la plupart des robots IA voient une page vide. Vérifiez avec le code source (Ctrl+U) : si le texte n’y est pas, il faut activer le rendu serveur pour les pages clés.