Les récentes versions de modèles d’IA au cours de la seconde moitié de 2025 ne se sont pas améliorées dans l’exécution des tâches liées au référencement.
TL;DR : Ce que vous devez savoir sur le benchmark LLM
- Claude Opus 4.1 reste le meilleur modèle de langage pour effectuer des tâches liées au référencement telles que le référencement technique, la localisation, la stratégie de référencement et l'optimisation des pages.
- ChatGPT-5 s'est amélioré dans notre benchmark malgré la réaction négative du public à sa version initiale.
- Copilot, qui exploite GPT-5, est aussi performant que le modèle d'OpenAI. Il s’agit d’une mise à niveau majeure car elle était auparavant sous-performante.
- Gemini 2.5 Pro est une troisième option intéressante. Il a l'impact potentiel le plus important pour les référenceurs et les spécialistes du marketing en raison de l'intégration des produits de base (Gmail, Sheets, Slides, Docs) et des modalités axées sur l'IA qui poussent encore plus loin son utilité (Opal, NotebookLM).
Le benchmark IA SEO
En avril, Previsible a lancé l'AI SEO Benchmark, un effort structuré pour évaluer l'efficacité avec laquelle les grands modèles de langage (LLM) peuvent effectuer des tâches de référencement dans le monde réel. Cette étude visait à répondre à deux questions principales :
- L’IA peut-elle effectuer de manière fiable des tâches de référencement à un niveau expert ?
- À mesure que ces modèles s'améliorent, leur utilité changera-t-elle la façon dont les spécialistes du marketing doivent ressources pour les tâches de référencement et de géolocalisation ?
Pour y répondre, nous avons organisé un ensemble complet de questions portant sur plusieurs disciplines du référencement, de la stratégie de contenu, de l'optimisation des pages, de la création de liens et du référencement technique. Ces questions ont été développées par une équipe de professionnels du référencement chevronnés possédant plus de 10 ans d’expérience dans leurs spécialités respectives.
Nous avons ensuite soumis les principaux LLM à cette batterie de questions, en notant leurs réponses sur 100. Cette approche d'analyse comparative reflète la manière dont les performances de l'IA sont testées dans des domaines tels que le développement de logiciels, le raisonnement mathématique et les tâches logiques.
Premiers résultats
Notre premier benchmark en avril a donné des résultats impressionnants, bien que sans surprise :
- Les LLM ont bien performé dans les tâches de référencement axées sur le contenu telles que la stratégie de mots clés et la création de métadonnées.
- Cependant, les LLM ont eu du mal avec le référencement technique, où la précision et la prévisibilité sont essentielles.
Une nouvelle vague de modèles
Depuis, le paysage a radicalement changé. Presque tous les principaux fournisseurs d'IA ont publié un nouveau modèle (à l'exception notable de Meta's Llama). Avec cet afflux de fonctionnalités mises à jour, nous avons réexécuté le benchmark et actualisé le classement.
Alors, comment se comparent les derniers modèles ? Et qu'est-ce que cela signifie sur la façon dont les équipes SEO allouent le temps, les outils et les talents ?
Dans le prochain épisode, nous partagerons les scores mis à jour, la répartition des performances par discipline SEO et les implications pour les spécialistes du marketing.
Beaucoup de choses ont changé depuis avril, alors jetons un coup d'œil au classement maintenant que presque toutes les grandes sociétés d'IA ont publié de nouveaux modèles (à l'exception de Llama).
Benchmark SEO IA
L'indice de référence a connu quelques mouvements mais n'a pas dépassé le plafond de ce qui était possible en avril.
Si vous n'êtes pas un référenceur qualifié, je serais extrêmement prudent avant de faire confiance à des LLM pour effectuer des tâches de référencement.
En recherchant cet article, nous avons contacté la communauté SEO pour obtenir des exemples d’IA devenue folle.
Voici quelques exemples :
- Lorsque j'ai commencé à utiliser l'IA pour le référencement, elle a trouvé 404 erreurs pour des URL qui n'existaient pas, qui, selon AI, contenaient des backlinks. J'ai présenté ces résultats à l'équipe de développement et à la direction comme une sorte de grande « victoire ».
- J'avais besoin d'effectuer une analyse de baisse de classement pour un grand site avec un délai d'exécution court. J'ai effectué l'analyse via ChatGPT et j'ai été impressionné par la catégorisation et les informations. L’équipe était enthousiasmée et souhaitait une analyse approfondie, une analyse plus approfondie et une présentation des résultats. Lorsque j’ai creusé un peu plus, toutes les « analyses » sous-jacentes se sont avérées être significativement erronées, et j’ai dû recommencer et j’ai eu l’air stupide.
- Les LLM ne respectent pas le nombre de mots ; ils ne les comprennent même pas, alors on me fait croire. J'ai donc exécuté un script qui a automatisé quelques milliers de pages de modifications HTML et le résultat a été des paragraphes complets de contenu et des essais dans des balises de titre (160 caractères maximum habituels !) qui coûtent également bien plus que ce que je voulais payer !
Ce sont des expériences anecdotiques, mais elles proviennent de référenceurs professionnels. Si vous êtes un cadre soucieux de la recherche, vous avez toujours besoin de référenceurs qualifiés capables d'utiliser correctement les LLM.
Les progrès de l’IA ont-ils ralenti ?
Pour ceux qui ne sont pas « AGI-pilled », vous avez probablement remarqué le rythme modéré du changement cette année. Il y a des perturbations, mais elles ont surtout un impact sur la bulle de battage médiatique, ChatGPT-5 étant particulièrement sous-performant après ses débuts.
Ce n’est pas surprenant si l’on considère ce qu’Ilya Sutskiver a déclaré à Reuters l’année dernière à propos de « l’intensification de la pré-formation – la phase de formation d’un modèle d’IA qui utilise une grande quantité de données non étiquetées pour comprendre les modèles et les structures linguistiques – a atteint un plateau ».
L’IA continuera de progresser. Ce benchmark se concentre sur les entreprises de services publics actuelles.
Si ces outils n’apportent pas de valeur ou d’efficacité à nos flux de travail actuels, à quoi servent-ils ? Google a fait des progrès dans ce domaine.
Google est le cheval noir
Il y a un an, j'avais radié les premiers modèles Gemini de Google. En tant qu’utilisateur précoce, l’expérience était décevante et, franchement, inutilisable. Cependant, mon point de vue a complètement changé avec la sortie de Gemini 2.5 Pro.
Gemini 2.5 non seulement fonctionne de manière impressionnante dans notre benchmark, mais il est également profondément intégré dans l'écosystème Google. C'est là que réside son véritable avantage.
Je peux désormais rédiger un e-mail qui comprend automatiquement le contexte des documents que j'ai créés dans Google Drive, référencer des réunions à partir de Calendrier ou extraire des informations de Google Docs et Sheets, le tout dans une seule interface. Il s'agit d'un utilitaire réel et transparent qu'aucun autre LLM n'offre actuellement à grande échelle.
Alors que de nombreux LLM peinent à créer un fossé durable, Google en possède déjà un : l'intégration omniprésente des données. La possibilité de récupérer et d'agir sur des informations pertinentes dans tous les produits Google constitue un avantage stratégique difficile à reproduire.
Est-ce parfait ? Pas encore. Cependant, si le rythme d’amélioration des produits se poursuit, Google pourrait tranquillement devenir l’acteur le plus dominant dans le domaine de l’IA appliquée.
Appliquer le benchmark : où en est l'IA aujourd'hui
Nous avons construit cette référence pour en faire un outil vivant, quelque chose que nous continuerons à mettre à jour à mesure que de nouveaux modèles seront publiés et que les capacités évolueront. Alors, où en est-on en septembre 2025 ?
L’IA peut-elle effectuer de manière fiable des tâches de référencement à un niveau expert ?
Non. Malgré les avancées majeures des LLM, la plupart manquent encore d'exécution de niveau expert, en particulier dans les domaines nécessitant une stratégie nuancée, une précision technique ou une réflexion systémique.
Les améliorations du modèle changeront-elles la façon dont les spécialistes du marketing utilisent les fonctions SEO et GEO ?
Pas de manière significative. Nous constatons des gains progressifs en termes de rapidité et de support pour certaines tâches, mais pas suffisamment pour justifier un changement complet dans la structure de l'équipe ou la stratégie d'investissement. L’utilité réside dans les gains d’efficacité et non dans l’automatisation à grande échelle.
Bref, ne vous attendez pas à ce que ChatGPT ou Gemini remplacent votre équipe SEO. Attendez-vous à ce qu’ils l’améliorent lorsqu’ils sont utilisés à bon escient.
L'IA déçoit toujours sur les tâches complexes. Mais l’écart se réduit.
Restez à l'écoute du benchmark. Plus important encore, commencez à exploiter ces outils avant vos concurrents. L'adoption précoce n'est pas seulement un gain de productivité : c'est un avantage stratégique.