Ia : le chaos algorithmique révèle les failles des chatbots
L’intelligence artificielle, autrefois présentée comme une promesse d’efficacité, se révèle aujourd’hui aussi fragile que précaire. Une étude récente, menée par Legal Guardian Digital, démasque les limites de ces assistants virtuels, mettant en lumière une propension alarmante à l’hallucination – c’est-à-dire à inventer des faits.
Le flou algorithmique : l’ia se contredit
Les modèles de langage étalés (LLM) apprennent en analysant des schémas statistiques pour prédire le mot suivant. Or, lorsqu’ils sont confrontés à une requête impossible à résoudre, ils se contentent de « bricoler », assemblant des mots qui, statistiquement, semblent cohérents – mais qui sont souvent totalement erronés. Une vérification humaine reste donc indispensable, notamment pour des données sensibles comme les prix boursiers ou les dates.

Google gemini en première ligne – et en danger
Le rapport révèle que Google Gemini, le chatbot particulièrement médiatisé, est le plus enclin à ces hallucinations, produisant des erreurs dans 32% de ses réponses. Une situation qui, selon certains observateurs d’Apple, suscite des interrogations au sein du géant de la Silicon Valley, qui investit massivement dans un modèle de langage de 1,2 trillion de paramètres, conçu pour alimenter Siri.

Chatgpt, un concurrent à surveiller
ChatGPT, quant à lui, hallucine dans environ trois réponses sur dix. Perplexity AI, en revanche, affiche des taux de 13% seulement, ce qui en fait un choix plus fiable – du moins pour l’instant. L’étude souligne également une disparité notable en termes de disponibilité : Perplexity AI et Grok, les seuls modèles à fonctionner de manière continue, se distinguent par leur fiabilité, contrairement à DeepSeek et ChatGPT, qui connaissent des interruptions occasionnelles.
Une question de coût et de performance
L’étude met en lumière un paradoxe : DeepSeek, entraîné avec un budget bien inférieur à celui de ChatGPT, se positionne comme un concurrent sérieux. Seuls deux chatbots, Perplexity AI et Grok, ont atteint un taux de disponibilité quasi-total (99,95% et 99,68% respectivement), témoignant d’une attention particulière portée à la stabilité du système. Le score d’indexation, qui agrège ces différents paramètres, révèle que Perplexity AI domine le classement avec 85, suivi de Grok (79) et DeepSeek (78). ChatGPT, avec un score de seulement 41, se retrouve en retrait.
Meta ai : le dernier du groupe
Meta AI, quant à lui, affiche les performances les plus faibles, avec un score de 37. Il est le seul modèle à ne pas avoir atteint un score supérieur à 40. Il est donc clair que la course à l'IA n'est pas encore terminée, et que la fiabilité des chatbots reste un défi majeur.
