Les IA pourront plus facilement aspirer le contenu Wikipédia
Les grands modèles de langage nécessitent des données et Wikipédia est une ressource précieuse pour les développeurs de cette technologie. Wikimedia Deutschland a récemment annoncé le lancement du Wikidata Embedding Project, une nouvelle base de données…
Les grands modèles de langage nécessitent des données et Wikipédia est une ressource précieuse pour les développeurs de cette technologie. Wikimedia Deutschland a récemment annoncé le lancement du Wikidata Embedding Project, une nouvelle base de données vectorielle qui facilitera l'exploitation des contenus de l'encyclopédie par l'intelligence artificielle.
Wikidata proposait déjà des solutions pour permettre aux machines d’exploiter le contenu de Wikipédia. Cependant, le Wikidata Embedding Project améliore cet accès, notamment pour les projets basés sur l'IA. Par exemple, une IA peut utiliser cet outil pour générer des réponses aux questions des utilisateurs de manière plus sémantique.
Le nouvel outil est compatible avec le protocole MCP, qui permet aux modèles d’intelligence artificielle de communiquer de manière autonome avec d’autres services. Ce protocole est utilisé par de nombreux chatbots pour interagir avec des outils comme Gmail ou Google Drive.
Les grands modèles de langage nécessitent des données et Wikipédia est une ressource précieuse pour les développeurs de cette technologie.
Pour les développeurs souhaitant utiliser le contenu des articles de Wikipédia, l’encyclopédie propose déjà un outil pour les contenus en anglais et en français. Ce jeu de données permet aux développeurs d’accéder à des ressources optimisées pour l’entraînement de l’IA, au lieu de parcourir les articles bruts avec des robots.
Un nouvel outil permet aux fonctionnalités basées sur l'IA d'exploiter plus efficacement le contenu de Wikipédia pour répondre aux requêtes utilisateurs. L'initiative est menée par Wikimedia Deutschland et l'outil est compatible avec le protocole MCP, facilitant la communication entre IA et autres services. Wikipédia a déjà lancé un outil pour aspirer son contenu afin d'entraîner les modèles de langage.
D’après Presse-citron.

:quality(50)/2026/08/12/6a7cde8dd98a2111045828.jpg)
:quality(50)/2026/08/13/6a7d5d9694a3a397795210.jpg)

:quality(50)/2026/08/13/6a7dca07783a5366981434.jpg)