Une trate de documents Google divulgués nous a donné un look sans précédent dans Google Search et a révélé certains des éléments les plus importants que Google utilise pour classer le contenu.
Ce qui s'est passé. Des milliers de documents, qui semblent provenir de l'entrepôt de contenu interne de Google, ont été publiés le 13 mars sur GitHub par un bot automatisé appelé Yoshi-Code-Bot. Ces documents ont été partagés avec Rand Fishkin, co-fondateur de Sparktoro, plus tôt ce mois-ci.
- Lisez la suite pour découvrir ce que nous avons appris de Fishkin, ainsi que Michael King, PDG d'Ipullrank, qui a également examiné et analysé les documents (et prévoit de fournir une analyse plus approfondie des terrains de moteur de recherche bientôt).
Pourquoi nous nous soucions. Nous avons eu un aperçu de la façon dont l'algorithme de classement de Google peut fonctionner, ce qui est inestimable pour les référencement qui peuvent comprendre ce que tout cela signifie. En 2023, nous avons eu un aperçu sans précédent des facteurs de classement des yandex via une fuite, qui a été l'une des plus grandes histoires de cette année.
Cette fuite de document Google? Ce sera probablement l'une des plus grandes histoires de l'histoire du référencement et de la recherche Google.
Qu'y a-t-il à l'intérieur. Voici ce que nous savons des documents internes, grâce à Fishkin et King:
- Actuel: La documentation indique que ces informations sont exactes en mars.
- Caractéristiques de classement: 2 596 modules sont représentés dans la documentation de l'API avec 14 014 attributs.
- Pondération: Les documents n'ont pas précisé comment les caractéristiques de classement sont pondérées – juste qu'elles existent.
- Twiddlers: Ce sont des fonctions de reconstitution qui «peuvent ajuster le score de recherche d'informations d'un document ou modifier le classement d'un document», selon King.
- Demotions: Le contenu peut être rétrogradé pour diverses raisons, comme:
- Un lien ne correspond pas au site cible.
- Les signaux SERP indiquent l'insatisfaction de l'utilisateur.
- Revues de produits.
- Emplacement.
- Domaines de correspondance exacts.
- Porno
- Changement d'histoire: Google conserve apparemment une copie de chaque version de chaque page qu'il a jamais indexée. Ce qui signifie que Google peut «se souvenir» de chaque modification jamais apportée à une page. Cependant, Google utilise uniquement les 20 dernières modifications d'une URL lors de l'analyse des liens.
Les liens comptent. Choquant, je sais. La diversité et la pertinence des liens restent essentielles, selon les documents. Et PageRank est toujours très vivant dans les fonctionnalités de classement de Google. PageRank pour la page d'accueil d'un site Web est pris en compte pour chaque document.
- Cela ne prouve pas que les porte-parole de Google ont menti sur les liens qui ne sont pas un «facteur de classement des 3 premiers» ou des liens qui comptent moins pour le classement. Deux choses peuvent être vraies à la fois. Encore une fois, nous ne savons pas comment aucune de ces fonctionnalités est pondérée.
Les clics réussis sont importants. Cela ne devrait pas être un choc, mais si vous voulez bien vous classer, vous devez continuer à créer un contenu excellent et des expériences utilisateur, sur la base des documents. Google utilise une variété de mesures, notamment badclicks, Goodclicks, cale et cliquets non personnalisés.
De plus, des documents plus longs peuvent être tronqués, tandis que le contenu plus court obtient un score (de 0 à 512) en fonction de l'originalité. Des scores sont également donnés à votre argent votre contenu de vie, comme la santé et les nouvelles.
Qu'est-ce que tout cela signifie? Selon King:
- «(Y) vous avez besoin de conduire plus réussi Cliquez sur l'utilisation d'un ensemble plus large de requêtes et gagnez plus de diversité de liens si vous souhaitez continuer à classer. Conceptuellement, cela a du sens car un contenu très fort le fera. L'accent mis sur la conduite d'un trafic plus qualifié vers une meilleure expérience utilisateur enverra des signaux à Google que votre page mérite de classer. »
Les documents et les témoignages de l'essai US contre Google Antitrust ont confirmé que Google utilise des clics dans le classement – en particulier avec son système Navboost, « l'un des signaux importants » utilise Google pour le classement. En savoir plus sur notre couverture:
- 7 Documents de classement de recherche Google incontournable dans les expositions d'essai antitrust
- Comment fonctionne la recherche et le classement Google, selon Pandu Nayak de Google
La marque compte. Fishkin's Big à retenir? La marque compte plus que toute autre chose:
- « S'il y avait un conseil universel que j'avais pour les spécialistes du marketing cherchant à améliorer largement leur classement de recherche organique et leur trafic, ce serait: » Construisez une marque notable, populaire et bien reconnue dans votre espace, en dehors de la recherche Google. « »
Les entités comptent. La paternité vit. Google stocke les informations sur l'auteur associées au contenu et essaie de déterminer si une entité est l'auteur du document.
Siteutauthority: Google utilise quelque chose appelé «SiteAuthority».
- Google nous a dit que quelque chose comme celui-ci existait en 2011, après le lancement de la mise à jour de Panda, déclarant publiquement que «un contenu de faible qualité sur une partie d'un site peut avoir un impact sur le classement d'un site dans son ensemble».
- Cependant, Google a nié avoir un score d'autorité de site Web au cours des années depuis lors.
Données chromées. Un module appelé Chromeintotal Indique que Google utilise les données de son navigateur Chrome pour le classement.
Listes blanches. Quelques modules indiquent la liste blanche de Google certains domaines liés aux élections et à la covide – Autorité de l'isélection et iscovidlocalauthority. Bien que nous connaissions depuis longtemps que Google (et Bing) ont des «listes d'exception» lorsque «des algorithmes spécifiques ont un impact sur les sites Web par inadvertance».
Petits sites. Une autre caractéristique est petit-diviseur – pour un petit site ou un blog personnel. King a émis l'hypothèse que Google pourrait stimuler ou rétrograder de tels sites via un Twiddler. Cependant, cela reste une question ouverte. Encore une fois, nous ne savons pas avec certitude combien ces fonctionnalités sont pondérées.
Autres découvertes intéressantes. Selon les documents internes de Google:
- La fraîcheur est importante – Google regarde les dates dans la signature (bylé), URL (syntaxtique) et le contenu sur page (sémantique).
- Pour déterminer si un document est ou n'est pas un sujet de base du site Web, Google vectorise les pages et les sites, puis compare les incorporations de page (siteradius) aux incorporations du site (SiteFocusscore).
- Google stocke les informations d'enregistrement du domaine (Enregistrement).
- Les titres de page comptent toujours. Google a une fonctionnalité appelée titleMatchScore On pense que pour mesurer la façon dont un titre de page correspond à une requête.
- Google mesure la taille moyenne de la police pondérée des termes dans les documents (poids AVG) et le texte d'ancrage.
Les articles.
- Secrets de l'algorithme: la documentation d'ingénierie interne de Google Search a divulgué par King sur ipullrank
- Une source anonyme a partagé des milliers de documents d'API Google divulgués avec moi; Tout le monde en référence devrait les voir par Fishkin sur Sparktoro
Mise à jour, 29 mai. Google a fourni une déclaration aux terrains du moteur de recherche. Lisez notre suivi: Google répond à la fuite: la documentation manque de contexte.
Mise à jour, 30 mai. King a écrit un article de suivi pour les terres de moteur de recherche:
- Comment le référencement avance avec la fuite de l'API de l'entrepôt de contenu Google
- Rejoignez Mike King et moi chez SMX Advanced pour une session de rupture tardive explorant la fuite et ses implications. Apprenez-en plus ici.
Creusez plus profondément. Déballage la fuite de documentation de recherche massive de Google
Clarification rapide. Il y a un litige quant à savoir si ces documents ont été «divulgués» ou «découverts». On m'a dit qu'il est probable que les documents internes ont été accidentellement inclus dans une revue de code et poussé en direct à partir de la base de code interne de Google, où ils ont ensuite été découverts.
La source. Erfan Azimi, PDG et directeur du référencement de l'agence de marketing numérique Ea Eagle Digital, a publié une vidéo, revendiquant la responsabilité du partage des documents avec Fishkin. Azimi n'est pas employé par Google.
Dixon Jones, PDG d'InLinks, a rendu les 14 000 variables de recherche Google consultables. Jones a déclaré que cet outil vous dira ce que Google stocke et pour quoi ils sont utilisés.
Histoires connexes
Nouveau sur les terres du moteur de recherche
Google donne plus de flexibilité des annonces de recherche réactives
Présentation de Google AI plus volatile que les classements organiques: rapport
LinkedIn lance deux outils pour améliorer l'attribution marketing
Comment restructurer votre site Web à l'aide de Personas: un guide pour de meilleurs résultats
Google Posts Get Get Ai-Images Fonction des images
