Reddit poursuit quatre sociétés de grattage de données en justice – dont le moteur de recherche d'IA Perplexity et la société de données SEO SerpApi – les accusant d'utiliser illégalement son contenu via les résultats de recherche Google.
Le procès. SerpApi, Oxylabs, AWMProxy et Perplexity « ont conçu un plan » pour récupérer indirectement les données Reddit de Google, puis les revendre ou les réutiliser pour entraîner des modèles d'IA. C'est ce que révèle le procès de Reddit, déposé aujourd'hui devant le tribunal de district américain du district sud de New York.
- Reddit a allégué que les entreprises avaient caché leur identité pour contourner les restrictions techniques et récupéré leurs données « à une échelle industrielle ».
- Reddit demande des dommages financiers, une injonction permanente et une interdiction d'utiliser ou de vendre des données précédemment récupérées.
- SerpAPI était ou est un client d'OpenAI, ce qui explique comment les résultats de recherche Google apparaissent parfois dans ChatGPT.
Pourquoi Reddit a poursuivi. Reddit concède déjà ses données sous licence à OpenAI et Google – mais a déclaré que d'autres avaient tenté de contourner ces accords.
- La plainte affirme que Reddit a même « tendu un piège » à Perplexity, en créant une publication de test visible uniquement par le robot d'exploration de Google. En quelques heures, ce message est apparu dans les résultats de recherche de Perplexity – preuve que l'entreprise s'est appuyée sur des données Google récupérées, a déclaré Reddit.
Pourquoi nous nous en soucions. Il est plus difficile que jamais pour les référenceurs et les propriétaires de sites d'accéder à des données de recherche fiables. Google réprime la suppression et le renforcement des API au moment même où les sites Web voient le trafic baisser grâce aux aperçus de l'IA et aux résultats sans clic. Le résultat : moins de visibilité, moins d’informations et un environnement plus difficile à comprendre – ou à influencer – la recherche IA.
Entre-temps. Reddit et Google discuteraient d'un nouveau partenariat qui intégrerait le contenu Reddit plus directement dans les produits d'IA de Google. Si ces discussions progressent, davantage de discussions sur Reddit pourraient faire surface dans les aperçus de l'IA et d'autres expériences Google, ce qui pourrait potentiellement remodeler davantage la façon dont Reddit et Google influencent la visibilité et le trafic de votre marque.
La grande image. L'IA scraping continue d'augmenter, mais elle ne renvoie toujours pas de visiteurs significatifs. Google envoie 831 fois plus de visiteurs que les systèmes d'IA, selon TollBit.
- Cloudflare a partagé des données en juillet mettant en évidence le ratio asymétrique des explorations par rapport au nombre de visiteurs envoyés vers un site Web :
- Google: 18:1
- OpenAI : 1 500:1
- Anthropique : 60 000:1
- Google et les créateurs de contenu travaillaient en symbiose – mais cette relation est devenue conflictuelle depuis l’émergence de l’IA générative en raison de la montée du zéro clic et du déclin du trafic organique.
Le rapport du New York Times. Reddit accuse les sociétés de « grattage de données » d'avoir volé ses informations (abonnement requis)
Mise à jour – Perplexité répond. Perplexity a répondu, sur Reddit, au procès. En partie, Perplexity a déclaré :
- « Alors, pourquoi poursuivre Perplexity ? Notre hypothèse : il s'agit d'une démonstration de force dans les négociations sur les données de formation de Reddit avec Google et OpenAI. (Perplexity ne forme pas de modèles de base !)
- » Que fait réellement Perplexity avec le contenu de Reddit ? Nous résumons les discussions sur Reddit et nous citons les fils de discussion de Reddit dans les réponses, tout comme les gens partagent tout le temps des liens vers des publications ici. »
- « Reddit a changé d'avis cette semaine quant à savoir s'ils souhaitent que les utilisateurs de Perplexity trouvent votre contenu public au cours de leur parcours d'apprentissage. Reddit pense que c'est leur droit. Mais c'est le contraire d'un Internet ouvert. »