GLM-5.3 : le nouveau modèle de Z.ai pour code et cybersécurité

Date:

GLM-5.3 : un virage stratégique pour Z.ai

Z.ai, anciennement connue sous le nom de Zhipu AI, a présenté GLM-5.3 le 14 août 2026 comme une évolution majeure de sa famille de modèles. Cette version met l’accent sur deux axes particulièrement observés dans l’IA actuelle : le développement logiciel autonome et la cybersécurité. Le modèle est d’abord proposé via le GLM Coding Plan et l’environnement ZCode, avant une diffusion plus large des poids annoncée quelques semaines plus tard. Ce lancement illustre une tendance nette du marché : les modèles ne sont plus seulement évalués sur leurs réponses textuelles, mais sur leur capacité à agir dans des tâches longues, techniques et à fort enjeu.

Une évolution construite sur une base déjà puissante

Plutôt que de repartir de zéro, Z.ai a conservé GLM-5.2 et son architecture de 743 milliards de paramètres, puis a concentré l’effort sur le post-entraînement. L’idée est simple mais ambitieuse : optimiser le comportement du modèle pour des missions qui ressemblent à de vrais projets d’ingénierie, parfois étalés sur plusieurs jours. Cette approche permet d’améliorer la spécialisation sans forcément réinventer entièrement la base. Elle répond à un besoin concret des équipes techniques, qui attendent désormais d’une IA qu’elle comprenne un dépôt de code, propose des modifications cohérentes et suive un objectif sur la durée.

Des progrès mesurables sur les tâches de code

Les résultats annoncés par Z.ai montrent des gains marqués sur plusieurs bancs d’essai. Sur Terminal-Bench 3.0, le score passe de 4,6 à 28,3. Sur DeepSWE v1.1, il progresse de 46,2 à 66,9. Enfin, AutomationBench bondit de 26,2 à 48,2. Dans le benchmark interne Z.ai Code Bench, l’entreprise évoque même un gain d’environ 50 % par rapport à GLM-5.2, tout en abaissant la sortie maximale à 75 000 jetons, contre 96 000 auparavant. Ces chiffres suggèrent un modèle mieux ciblé sur la résolution de tâches complexes et moins dispersé dans ses réponses.

  • Terminal-Bench 3.0 : forte hausse, utile pour les environnements proches du terminal.
  • DeepSWE v1.1 : progression notable sur des scénarios de génie logiciel.
  • AutomationBench : amélioration sur l’automatisation de tâches.
  • Z.ai Code Bench : gain global revendiqué proche de 50 %.

La cybersécurité, un second terrain d’expérimentation

GLM-5.3 ne se limite pas à écrire du code. Durant son post-entraînement, il a aussi été exposé à des données liées à l’analyse de vulnérabilités, ce qui aurait fait émerger des capacités de cybersécurité plus fortes que prévu. Z.ai affirme que le modèle peut aller au-delà d’une simple détection de faille et construire une chaîne d’exploitation complète, ce qui change radicalement son profil. Sur CyberGym, il atteindrait 84,5 % de réussite, contre 77,2 % pour GLM-5.2. Sur ExploitBench, il grimperait à 54,4 %, contre 24,4 % pour la génération précédente.

Selon l’entreprise, des équipes de sécurité chinoises auraient aidé à identifier 2 436 vulnérabilités sur 269 projets, dont 1 097 jugées critiques ou élevées. Z.ai indique aussi que 53 failles ont déjà été divulguées publiquement, tandis que 2 383 restent sous embargo. La vulnérabilité la plus ancienne remonterait à 1981, avec un âge moyen annoncé de 26,6 ans. Une autre alerte circule concernant l’environnement Cursor, mais elle provient d’une publication sur X et n’a pas été confirmée officiellement.

Une API plus encadrée et un modèle plus coûteux à l’usage

Avec GLM-5.3, l’expérience développeur évolue aussi. Dans l’API, le mode de réflexion thinking ne peut plus être désactivé : il faut choisir entre low, high ou max. Ce choix reflète une volonté de mieux contrôler l’effort de raisonnement du modèle selon les cas d’usage. Côté tarification, le Coding Plan commence à 12,60 dollars par mois pour la formule Lite, avec 10 000 crédits hebdomadaires. L’offre Max monte à 117,60 dollars, tandis que les forfaits équipe s’affichent à 88 et 188 dollars par utilisateur et par mois. Un système de quotas permet par ailleurs une réduction de 50 % pendant les heures creuses.

  • Thinking imposé dans l’API, avec trois niveaux d’effort.
  • Lite : 12,60 dollars par mois.
  • Max : 117,60 dollars par mois.
  • Offres équipe : 88 ou 188 dollars par utilisateur et par mois.

Le rapport coût-performance, vrai point fort du modèle

Au-delà des performances brutes, GLM-5.3 attire l’attention par son positionnement économique. Dans un test indépendant centré sur la détection de failles IDOR, il obtient un score F1 de 23,8 %, pour un coût de 0,15 dollar par vraie détection. À titre de comparaison, Claude Opus 5 atteint 65,6 %, mais pour 0,44 dollar par vrai positif, tandis que Claude Opus 4.8 affiche 23,6 % pour 1,04 dollar. Le résultat de Z.ai est donc particulièrement intéressant pour les équipes qui cherchent un compromis entre budget et efficacité opérationnelle. Un détail demeure cependant à surveiller : GLM-5.2 avait obtenu 26,8 % sur le même test, ce qui oblige à rester prudent avant d’interpréter l’écart comme une progression définitive.

  • GLM-5.3 : bon équilibre entre coût et performance.
  • Claude Opus 5 : performance supérieure, mais plus onéreuse.
  • Claude Opus 4.8 : coût nettement plus élevé pour un score proche.
  • La comparaison avec GLM-5.2 invite à vérifier la stabilité des résultats.

En savoir plus sur L'ABESTIT

Subscribe to get the latest posts sent to your email.

Share post:

Popular

More like this
Related

IA opaques : entreprises aux statuts flous et données douteuses

Difficile de savoir qui se cache derrière ces entreprises aux statuts opaques, qui modèrent peu leurs contenus et entraînent leurs IA sur des données à la légalité douteuse....

Forages en eaux profondes de Petrobras contestés par les écologistes

La compagnie publique Petrobras, qui a annoncé avoir détecté des indices de la présence d’hydrocarbures en eaux profondes, poursuit ses forages pour mesurer l’ampleur du gisement. Les défenseurs de l’environnement contestent l’exploration....

Des colons bloquent l’accès à des maisons palestiniennes à Qusra

Depuis le 9 août 2026, quelques dizaines de colons bloquent l’accès à des maisons palestiniennes dans le village de Qusra, près de Naplouse....

Incendies : 12 millions d’euros pour la Gironde et les Landes

Le premier ministre avait annoncé plus tôt une aide de 12 millions d’euros pour la Gironde et les Landes, durement touchées par les incendies cet été....