Claude Mythos est confirmé par des tests comme leader dans la détection de vulnérabilités, mais il présente également d’autres défauts.
Résumé
La société XBOW a mené une évaluation indépendante du modèle d’IA Mythos Preview d'Anthropic. Les résultats montrent que le modèle dépasse les analogues existants dans la recherche de vulnérabilités de code source et lorsqu’il travaille avec du code natif et le reverse‑engineering, mais présente des faiblesses dans l’analyse de code isolé et la confirmation de la praticabilité des exploits trouvés. Le coût d’utilisation du modèle reste un sujet : Mythos est plus cher qu’Opus, cependant, avec un budget limité en jetons, il démontre parfois une meilleure précision.
1. Ce que XBOW a vérifié
- Volume des tests – série d’expériences indépendantes sur Mythos Preview.
- Scénarios – audit de systèmes fonctionnels avec accès au code source, analyse de code isolé, reverse‑engineering et interaction avec l’interface graphique.
2. Conclusions clés
Indicateur | Mythos Preview | Modèles concurrents
--- | --- | ---
Détection de vulnérabilités | Meilleur indicateur parmi tous les modèles, surtout en code source et programmation native. Moins précis mais parfois plus fiable pour des cas spécifiques. |
Réduction des faux positifs | Supprime davantage de « faux » découvertes que ses prédécesseurs. Souvent génère plus d’alertes fausses. |
Problèmes avec le code isolé | Le modèle se débrouille moins bien sans contexte système. Certains modèles fonctionnent mieux en analyse ligne par ligne. |
Confirmation des exploits | Tendance à une approche littérale, parfois surestime la valeur pratique des découvertes. Plus critique quant à l’applicabilité réelle. |
Reverse‑engineering et code natif | Produits de solides résultats ; comprend bien la logique d’un programme sans code source. Moins précis dans ces tâches. |
Interaction avec l’UI | Ne trouve pas toujours précisément les coordonnées des éléments, mais détermine correctement les actions nécessaires dans le navigateur. Certains modèles sont plus précis en positionnement.
3. Coût et efficacité
- Tarification – Anthropic a déclaré que Mythos coûterait cinq fois plus cher qu’Opus.
- Analyse économique – XBOW a mené des expériences avec des modèles « bon marché », leur donnant plus de temps d’exécution. Les résultats montrent que, normalisé par coût, le travail de Mythos Preview ne semble pas extravagant pour les tâches nécessitant une haute précision.
- Benchmarks – Avec un budget fixe en jetons, Mythos dépasse Opus 4.6 dans la recherche de vulnérabilités web, mais reste inférieur à GPT5.5.
4. Résumé
Mythos Preview démontre une puissance exceptionnelle lors de l’audit de code source et de programmes natifs, ainsi que pour le reverse‑engineering et l’analyse d’applications web. Cependant, le modèle sous‑évalue parfois la praticabilité réelle des vulnérabilités découvertes et présente des faiblesses dans l’analyse isolée du code. Avec des ressources jetons limitées, Mythos peut être plus rentable qu’Opus, mais avec un budget complet GPT5.5 reste compétitif.
Conclusion de XBOW : Mythos Preview est un outil fiable pour identifier les vulnérabilités potentielles dans le code source et les systèmes complexes, mais nécessite une confirmation supplémentaire de la valeur pratique des exploits trouvés.
Commentaires (0)
Partagez votre avis — merci de rester courtois et dans le sujet.
Connectez-vous pour commenter