Les chercheurs de Microsoft affirment que les modèles d’IA ne sont pas encore capables de résoudre des problèmes complexes.

Les chercheurs de Microsoft affirment que les modèles d’IA ne sont pas encore capables de résoudre des problèmes complexes.

25 hardware

Les chercheurs de Microsoft ont identifié les limites des modèles linguistiques volumineux (LLM) modernes lorsqu'ils exécutent des tâches complexes à répétition

Dans le cadre d'expériences, Microsoft Research a découvert que même les modèles d'IA les plus avancés commettent des erreurs graves lorsqu'on leur demande d'effectuer des opérations longues et multi-étapes. Parmi les systèmes testés – Gemini 3.1 Pro, Claude 4.6 Opus et GPT 5.4 – chaque modèle a perdu en moyenne environ 25 % du contenu des documents après un traitement autonome.

Ce qui a été testé
* Benchmark DELEGATE‑52

Créé par l'équipe de Philippe Labana, Tobias Schnabel et Jennifer Neville. Il modélise les flux de travail dans 52 domaines professionnels : de la programmation et de la notation musicale à la cristallographie.

* Critère d'évaluation

Les modèles ont été évalués sur leur capacité à préserver l'intégrité du document après 20 cycles de traitement. Le seuil de «prêt» a été fixé à 98 % – si le résultat tombait en dessous, la tâche était considérée comme échouée.

Principaux résultats
Domaine Meilleures performances Programmation Les meilleures performances Langage naturel Modèles les moins fiables
* Baisse de qualité

Dans plus de 80 % des combinaisons de documents, la qualité est tombée à 80 % ou moins. Le meilleur modèle (Gemini 3.1 Pro) a satisfait aux critères de préparation que dans 11 sur 52 domaines.

* Erreurs en sauts

Les pertes ne se produisaient pas progressivement mais «en saut» : en un seul cycle d'interaction, le modèle pouvait perdre entre 10 et 30 % de précision. Les modèles les plus avancés (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) tentaient d'éviter les petites erreurs, reportant leur traitement à des étapes ultérieures et réduisant le nombre d'interactions.

* Gestion par agent

Lors de l'utilisation d'outils en mode gestion par agent, les résultats ne s'amélioraient pas : vers la fin du cycle, la qualité chutait d'environ 6 %.

Que cela signifie pour les utilisateurs
Les scientifiques soulignent que les utilisateurs doivent toujours surveiller attentivement le fonctionnement des systèmes IA lorsqu'ils leur délèguent des pouvoirs. Les modèles actuels sont capables de fonctionner de manière autonome uniquement dans des domaines étroits.

Cependant, les auteurs du benchmark notent une progression notable : la famille de modèles OpenAI a amélioré ses performances de 14,7 % à 71,5 % en 16 mois. Cela confirme que les LLM continuent d'évoluer, mais restent encore limités dans les tâches complexes à répétition.

Commentaires (0)

Partagez votre avis — merci de rester courtois et dans le sujet.

Pas encore de commentaires. Laissez un commentaire et partagez votre avis !

Pour laisser un commentaire, connectez-vous.

Connectez-vous pour commenter