vendredi 14 août 2026S’abonner
Travail, ville et vie quotidienne
Indépendant · Numérique
Métro Boulot Dodo
NumériqueAssisté par IA

Les IA pourront plus facilement aspirer le contenu Wikipédia

Les grands modèles de langage nécessitent des données et Wikipédia est une ressource précieuse pour les développeurs de cette technologie. Wikimedia Deutschland a récemment annoncé le lancement du Wikidata Embedding Project, une nouvelle base de données…

Les grands modèles de langage nécessitent des données et Wikipédia est une ressource précieuse pour les développeurs de cette technologie. Wikimedia Deutschland a récemment annoncé le lancement du Wikidata Embedding Project, une nouvelle base de données vectorielle qui facilitera l'exploitation des contenus de l'encyclopédie par l'intelligence artificielle.

Wikidata proposait déjà des solutions pour permettre aux machines d’exploiter le contenu de Wikipédia. Cependant, le Wikidata Embedding Project améliore cet accès, notamment pour les projets basés sur l'IA. Par exemple, une IA peut utiliser cet outil pour générer des réponses aux questions des utilisateurs de manière plus sémantique.

Le nouvel outil est compatible avec le protocole MCP, qui permet aux modèles d’intelligence artificielle de communiquer de manière autonome avec d’autres services. Ce protocole est utilisé par de nombreux chatbots pour interagir avec des outils comme Gmail ou Google Drive.

Les grands modèles de langage nécessitent des données et Wikipédia est une ressource précieuse pour les développeurs de cette technologie.
Théo Marchand · Métro Boulot Dodo

Pour les développeurs souhaitant utiliser le contenu des articles de Wikipédia, l’encyclopédie propose déjà un outil pour les contenus en anglais et en français. Ce jeu de données permet aux développeurs d’accéder à des ressources optimisées pour l’entraînement de l’IA, au lieu de parcourir les articles bruts avec des robots.

Un nouvel outil permet aux fonctionnalités basées sur l'IA d'exploiter plus efficacement le contenu de Wikipédia pour répondre aux requêtes utilisateurs. L'initiative est menée par Wikimedia Deutschland et l'outil est compatible avec le protocole MCP, facilitant la communication entre IA et autres services. Wikipédia a déjà lancé un outil pour aspirer son contenu afin d'entraîner les modèles de langage.

Publicité

D’après Presse-citron.

Transparence IA. Cet article a été produit avec l’assistance de l’intelligence artificielle et publié sous supervision éditoriale humaine. Les systèmes d’IA peuvent commettre des erreurs. Comment nous utilisons l’IA (règlement européen sur l’IA, art. 50).
À lire aussi