Avant que le GPT-3 d’OpenAI n’ouvre l’ère des modèles de base, les entreprises construisaient des modèles spécialisés de traitement du langage naturel à partir de zéro, en s’entraînant chacun sur de grandes quantités de données spécifiques à une tâche. Aujourd’hui, la plupart des organisations commencent avec un modèle à usage général comme la série GPT d’OpenAI, Claude ou Llama, puis l’affinent ou l’invitent à répondre à leurs besoins spécifiques.
Pim de Witte, PDG de General Intuition, pense que l’IA incarnée suivra un modèle similaire. Plutôt que de collecter d’énormes ensembles de données du monde réel pour créer des modèles de robots spécialisés, il soutient que l’industrie devrait se concentrer sur des ensembles de données de meilleure qualité, capables de produire des modèles de base capables de transférer l’intuition sur le mouvement et l’interaction dans de nombreux environnements.
« De nombreuses entreprises effectuent actuellement de nombreux travaux spécialisés axés sur des modes de réalisation individuels, des environnements individuels et des robots individuels », a déclaré de Witte à TechCrunch lors d’un récent épisode d’Equity.
Une grande partie de ce travail deviendra bientôt redondante, affirme-t-il, avec l’émergence de modèles généraux comme celui que General Intuition a développé et déployé.
« La généralisation du modèle lui-même est le produit », a-t-il déclaré. « Le fait qu’il ait un raisonnement de base sur l’espace et le temps sera la raison pour laquelle les gens cesseront de collecter des centaines de milliers ou des millions d’heures de données du monde réel. Parce que la réalité est que vous n’avez besoin que de quelques minutes. «
General Intuition a construit son propre modèle de base après une formation sur des millions d’heures de données de jeux vidéo, y compris des informations telles que les boutons d’un contrôleur qu’un humain a appuyés et quand. De Witte et l’investisseur principal de General Intuition, Vinod Khosla, affirment que les données d’action sont la clé pour développer une intuition humaine pour le raisonnement spatio-temporel.
La startup a levé le mois dernier 320 millions de dollars pour une valorisation de 2,3 milliards de dollars grâce à cette thèse. La société a démontré que son modèle actuel est capable à la fois de jouer à un jeu vidéo pendant des heures et d’alimenter un robot quadrupède – ce dernier après l’avoir peaufiné sur seulement huit minutes de données robotiques réelles.
« Le fait que (le robot) soit capable de faire un zéro sur la seule caméra frontale, sans aucun autre capteur, dans un bureau avec des objets dynamiques introduits et des passants, a été une très grande surprise pour nous », a déclaré de Witte. « Je pense que c’est un signe de ce qui va arriver. »
L’objectif final de General Intuition n’est pas de construire des robots eux-mêmes, mais de devenir le modèle de base de l’IA physique, un modèle de base sur lequel d’autres entreprises de robotique pourront s’appuyer pour leurs propres machines. Maintenant, comme l’a dit de Witte : « Nous n’allons pas créer une entreprise de voitures autonomes. Nous allons permettre à la prochaine personne de créer 10 fois plus facilement une entreprise de voitures autonomes. »
Lorsque vous achetez via des liens dans nos articles, nous pouvons gagner une petite commission. Cela n’affecte pas notre indépendance éditoriale.

