vendredi 14 août 2026S’abonner
Travail, ville et vie quotidienne
Indépendant · Numérique
Métro Boulot Dodo
NumériqueAssisté par IA

Cette IA a appris à comprendre le monde comme un être humain

Anticiper des événements, établir des corrélations ou comprendre les lois du monde réel sont des caractéristiques essentielles de l'intelligence que le modèle V-JEPA de Meta semble désormais capable d'imiter. En analysant des millions de vidéos, cette…

Anticiper des événements, établir des corrélations ou comprendre les lois du monde réel sont des caractéristiques essentielles de l'intelligence que le modèle V-JEPA de Meta semble désormais capable d'imiter. En analysant des millions de vidéos, cette intelligence artificielle a développé une forme d'intuition du monde physique et peut être « surprise » lorsqu'un événement enfreint les lois naturelles.

V-JEPA : Un Modèle Inspiré de la Cognition Infantile

Le modèle V-JEPA ( Video Joint Embedding Predictive Architecture ) est inspiré du développement cognitif des nouveau-nés. Il apprend en observant des vidéos, en inférant des régularités physiques, et en comparant constamment ses attentes à la réalité. Lorsqu'un objet disparaît ou traverse un obstacle, le modèle détecte une incohérence, similaire à la réaction d'un enfant conscient des lois immuables du monde.

Contrairement à d'autres modèles d'intelligence artificielle comme ChatGPT ou Gemini, qui analysent les vidéos pixel par pixel, V-JEPA opère à un niveau d'abstraction supérieur. Il utilise un espace latent pour comprendre les relations entre objets dans les vidéos, incluant morphologie, mouvements, interactions, positions relatives, continuité temporelle, causalité, et régularités physiques.

Testé sur le protocole IntPhys, conçu pour évaluer la compréhension intuitive de la physique, V-JEPA a atteint un taux de réussite de près de 98 %. Les autres modèles de vision artificielle testés, comme ViViT de Google et TimeSformer de Facebook AI, ont obtenu un score d'environ 55 %, proche du hasard statistique.

Anticiper des événements, établir des corrélations ou comprendre les lois du monde réel sont des caractéristiques essentielles de l'intelligence que le modèle V-JEPA de Meta semble désormais capable d'imiter.
Victor Nguyen · Métro Boulot Dodo

Lorsqu'un événement incohérent se produit, le modèle enregistre une « erreur de prédiction », l'équivalent mathématique de la surprise, indiquant que le monde perçu ne suit pas la logique apprise. Ce processus rappelle le comportement d'un enfant confronté à une impossibilité physique.

V-JEPA applique le principe d'apprentissage auto-supervisé, apprenant sans indications humaines. Il découvre seul les régularités, construisant des représentations internes ou modèles implicites de la réalité. Ce fonctionnement s'apparente à un « world model », une carte mentale du monde sans langage ou symbolique. À chaque observation, sa compréhension des causalités s'améliore, même sans reconnaître les objets individuellement.

Cependant, V-JEPA n'a pas atteint le niveau de métacognition. Il ne sait pas estimer l'incertitude de ses prévisions, ne comprenant pas à quel point ses anticipations sont fiables. Sa mémoire est limitée, ne permettant pas de comprendre des situations étendues dans le temps, un aspect comparé à celle d'un poisson rouge par Quentin Garrido, chercheur chez Meta.

Publicité

Bien que techniquement impressionnant, V-JEPA n'atteint pas encore la compréhension ou la conscience. Il modélise le monde, mais sans véritable compréhension, mimant le processus par lequel la conscience émerge sans intention consciente. V-JEPA apprend, mais sans réellement savoir ce qu'il apprend, restant ignorant de sa propre existence.

Meta a développé une IA capable d’apprendre seule les lois physiques en observant des vidéos. Le modèle reproduit certains mécanismes cognitifs humains, mais sans véritable compréhension. Malgré sa précision, il reste un système statistique sans conscience ni perception de soi.

D’après Presse-citron.

Transparence IA. Cet article a été produit avec l’assistance de l’intelligence artificielle et publié sous supervision éditoriale humaine. Les systèmes d’IA peuvent commettre des erreurs. Comment nous utilisons l’IA (règlement européen sur l’IA, art. 50).
À lire aussi