Comment structurer ses pages pour les IA : FAQ, données structurées et formats

La couche technique qui rend un contenu extractible : hiérarchie HTML, données structurées à poser, FAQ, tableaux, formats de fichiers, rendu et vérification

L’essentiel à retenir

  • La structure HTML : un H1, des H2 en questions, des paragraphes courts, des tableaux avec en-têtes, des listes ; tout le texte dans le HTML, sans dépendre du JavaScript.
  • Les données structurées : Article ou BlogPosting (auteur, dates), Organization ou LocalBusiness (entité), FAQPage (questions), BreadcrumbList, Person pour les auteurs.
  • Les formats : HTML d’abord ; PDF et images pour les compléments seulement ; transcriptions pour l’audio et la vidéo.
  • La vérification : code source, test des résultats enrichis, inspection d’URL, et un test de lecture dans Perplexity.

Un contenu bien rédigé pour les IA (voir structurer un contenu pour les LLM) doit être servi dans une page que les robots peuvent lire et interpréter. C’est la couche technique du GEO : hiérarchie HTML, données structurées, formats, rendu. Elle est partagée avec le SEO et se met en place une fois, au niveau des gabarits. Cet article liste ce qu’il faut poser, dans quel ordre, et comment vérifier.

La hiérarchie HTML

ÉlémentRèglePourquoi pour les IA
Titre de page (title)Le sujet en moins de 60 caractèresNom de la source dans la citation
H1Un seul, le sujet ou la question principaleIdentifie la page
H2 et H3Une question ou un sous-sujet par titre, dans l’ordreDécoupage des passages
ParagraphesCourts (3 à 5 phrases), un sujet chacun, dans des balises pUnités d’extraction
Tableauxtable, thead, th, tbody ; jamais en imageExtraction cellule par cellule, comparaisons
Listesul et ol pour les étapes et les critèresExtraction ordonnée
Mise en évidencestrong pour le terme défini, pas pour décorerRepère de définition
LiensAncres descriptives vers les pages liéesContexte et crédibilité
Balises sémantiquesarticle, header, main, nav, footer, timeDistinguer le contenu du gabarit

Les données structurées à poser

Type Schema.orgPropriétés clésEffet
Organization ou LocalBusinessToutes les pages (ou l’accueil et « qui sommes-nous »)name, url, logo, description, foundingDate, founder, address, sameAs, contactPointEntité reconnue et cohérente ; voir optimiser sa page « qui sommes-nous »
Article ou BlogPostingChaque articleheadline, description, author (Person), datePublished, dateModified, publisher, imageAuteur et fraîcheur attribués
PersonAuteurs, fondateurname, jobTitle, url, sameAs (LinkedIn), worksForExpertise identifiable
FAQPagePages avec FAQmainEntity : Question, acceptedAnswerQuestions et réponses lisibles ; extraits enrichis Google
BreadcrumbListToutes les pagesitemListElementPosition dans le site
HowToProcéduresstepÉtapes extractibles
Product, Service, OfferPages produits et servicesname, description, offers (price), aggregateRatingPrix et notes cités
VideoObject, PodcastEpisodePages vidéo et audiotranscript, duration, uploadDateContenu audiovisuel lisible ; voir référencer un podcast ou une vidéo

Utilisez le format JSON-LD dans un script en tête ou en pied de page. Les données structurées n’obligent aucune IA à vous citer, mais Google et Bing les lisent, et leurs index alimentent les assistants ; elles fixent sans ambiguïté qui écrit, quand, et de quoi il s’agit. Le détail pour le local est dans les balises Schema.org pour le local.

La FAQ

  • Trois à six questions réelles, formulées comme les utilisateurs les posent, en fin de page.
  • Réponses de 40 à 70 mots, autonomes, avec le sujet nommé et un fait.
  • Balisage FAQPage dont le texte correspond exactement au texte visible.
  • Dans le HTML, même si l’affichage est en accordéon.
  • Pas de doublon avec les sections : la FAQ traite les questions secondaires, les sections la question principale.

Les formats

FormatLisibilité par les IAUsage recommandé
HTMLExcellenteTout le contenu principal
PDFMoyenne (indexé par Google, moins bien par les robots IA ; structure perdue)Compléments téléchargeables, toujours doublés d’une page HTML
Images (texte dans l’image, infographies)FaibleIllustration ; le texte doit exister aussi en HTML, avec un alt
Vidéo, audioNulle sans transcriptionPublier la transcription structurée
Contenu chargé en JavaScriptFaible (la plupart des robots IA n’exécutent pas le JavaScript)Rendu serveur ou statique pour les pages clés
Markdown (llms.txt)BonneSommaire du site à la racine, en complément du sitemap

Le rendu et l’accès

Trois conditions techniques : le contenu est dans le HTML servi (rendu serveur ou statique), les robots de recherche IA sont autorisés dans le robots.txt, et la page est rapide et disponible. Un site en rendu client (React, Vue sans SSR) est le cas le plus fréquent de contenu invisible pour les IA. La liste des robots et les réglages sont dans l’indexation par les IA.

Vérifier

  1. Code source (Ctrl+U) : le texte, les titres, les tableaux et la FAQ y figurent.
  2. Test des résultats enrichis de Google et validateur Schema.org : données structurées sans erreur.
  3. Inspection d’URL dans la Search Console : HTML rendu et capture conformes.
  4. Test de lecture : demander à Perplexity « résume la page [URL] et liste ses sections » ; une réponse fidèle prouve la lisibilité.
  5. Crawler (Screaming Frog) pour vérifier la hiérarchie des titres et les données structurées sur tout le site.
Conseil : traitez la structure au niveau des gabarits, pas page par page : un gabarit d’article avec Article, Person, BreadcrumbList et FAQPage intégrés, un gabarit de page entreprise avec Organization, et un rendu serveur. Une fois posés, chaque nouvelle page en hérite, et le GEO technique devient gratuit.

Comment GreenRed vous aide

Plutôt que de jongler entre plusieurs outils, le module Santé du site de GreenRed réunit ces indicateurs dans un seul tableau de bord, les compare dans le temps et vous indique les actions prioritaires. Vous pouvez le tester gratuitement, sans carte bancaire, depuis la page Tarifs.

Questions fréquentes

Les données structurées sont-elles lues par ChatGPT ?

Pas directement pour la plupart des assistants, mais Google et Bing les lisent et leurs index alimentent ChatGPT, Perplexity, Gemini et Copilot. Elles fixent l’auteur, la date, l’entité et les questions sans ambiguïté, ce qui pèse dans la sélection des sources. Elles sont aussi nécessaires aux extraits enrichis de Google.

Faut-il une FAQ sur chaque page ?

Sur les pages qui répondent à des questions (articles, guides, pages services), oui : trois à six questions réelles avec des réponses courtes et un balisage FAQPage. Sur les pages de navigation ou les fiches produits simples, une FAQ artificielle n’apporte rien.

Un PDF est-il lu par les IA ?

Google indexe les PDF et peut les citer dans les aperçus IA ; les robots des autres assistants les lisent moins bien et la structure (titres, tableaux) se perd. Publiez le contenu en HTML et proposez le PDF en complément téléchargeable, jamais l’inverse.

Mon site est en React : est-il visible pour les IA ?

Seulement si le contenu est rendu côté serveur ou pré-généré (SSR, SSG). En rendu client pur, la plupart des robots IA voient une page vide. Vérifiez avec le code source (Ctrl+U) : si le texte n’y est pas, il faut activer le rendu serveur pour les pages clés.

Suivez votre visibilité sur les IA

GreenRed surveille si et comment ChatGPT, Perplexity et Gemini citent votre marque, et vos concurrents.

Tester GreenRed gratuitement

Articles connexes