À mesure que les LLM sont devenus plus puissants, les hallucinations se sont révélées obstinément difficiles à éviter. Des erreurs apparaissent même dans les modèles les plus intelligents, et bien qu’il existe des moyens de détecter ces erreurs, l’industrie cherche encore la meilleure façon de le faire.
Probablement, qui vient de lever 9 millions de dollars de financement de démarrage auprès d’Andreessen Horowitz, tente de mettre au point un moyen plus rigoureux de détecter ces erreurs.
Comme le dit le fondateur Peter Elias (photo ci-dessus), l’objectif de l’entreprise est d’empêcher les hallucinations et les simples erreurs factuelles d’atteindre l’utilisateur, et d’atteindre le type de précision de 99,99 % qui est courant dans les systèmes déterministes mais beaucoup plus difficile à atteindre avec l’IA. Il s’avère que pour amener les LLM à ce niveau de précision, il faut repenser bon nombre des hypothèses de base de l’ingénierie de l’IA.
Le premier produit de Probablement est un outil de science des données, conçu pour produire des réponses rapides à partir d’ensembles de données complexes. Chaque résultat est accompagné d’une citation et d’une piste d’audit expliquant comment il a été développé, une pratique de plus en plus courante parmi les outils d’IA.
Mais pour empêcher les erreurs de s’infiltrer dans ces résumés, il a fallu un système de harnais élaboré qu’Elias décrit comme une « combinaison mécanique de science des données ». Les réponses du premier passage du LLM sont vérifiées par rapport à un système de validation déterministe, qui renvoie tous les résultats qui ne correspondent pas à l’ensemble de données. Fondamentalement, le LLM a été formé par rapport au validateur et l’ensemble du système est optimisé pour des réponses rapides et précises, a indiqué la société.
« Ce que nous avons appris en construisant cela, c’est que plus l’ingénierie de votre harnais est bonne, plus le modèle peut être faible », explique Elias. « Si vous pouvez affiner suffisamment le contexte, le modèle n’a pas besoin de travailler très dur pour faire la bonne chose. Fondamentalement, il s’agit d’un exercice visant à réduire l’ambiguïté. »
Cela permet à l’outil de science des données de Probably de fonctionner sur des modèles d’IA nettement plus petits. Elias affirme que la version actuelle fonctionne sur un modèle « quatre classes plus faibles que les modèles frontières », ce qui signifie qu’elle peut être exécutée sur du matériel local (c’est-à-dire un ordinateur de bureau au lieu d’un centre de données), ce qui réduit considérablement les coûts de jetons associés à l’utilisation de l’IA.
C’est une idée bienvenue à une époque où les coûts des jetons augmentent et où de nombreux clients réévaluent leurs budgets IA. Et l’idée d’Elias ne s’arrête pas à la science des données, puisque le même moteur peut être étendu pour couvrir des cas d’utilisation tels que la comptabilité ou les services médicaux – comme le dit Elias, « tout cas d’utilisation sensible à la précision ».
« Je pense qu’il est vraiment intéressant que les grands laboratoires d’IA n’aient même pas tenté de le faire », déclare Elias. « Ils sont incités à ne pas le faire, car ils gagnent de l’argent à mesure qu’il faut corriger le modèle. »
Lorsque vous achetez via des liens dans nos articles, nous pouvons gagner une petite commission. Cela n’affecte pas notre indépendance éditoriale.

