Spécifications techniques de GLM-5.3
| Spécification | GLM-5.3 |
|---|---|
| Développeur | Z.ai / Zhipu AI |
| Sortie | 14 août 2026 |
| Type de modèle | Modèle fondation phare |
| Entrée | Texte |
| Sortie | Texte |
| Fenêtre de contexte | 1,000,000 tokens |
| Sortie maximale | 128,000 tokens |
| Raisonnement | Modes multiples |
| Streaming | Oui |
| Appel de fonctions | Oui |
| Sortie structurée | Oui |
| Mise en cache du contexte | Oui |
| MCP | Oui |
| Applications principales | Programmation, agents, ingénierie, cybersécurité |
Les dépôts publics de modèles de Z.ai affichent encore en évidence GLM-5.2, plutôt qu’un artefact GLM-5.3 téléchargeable ; les spécifications qui n’ont pas encore été publiées doivent donc rester explicitement indiquées comme non confirmées.
Qu’est-ce que GLM-5.3 ?
GLM-5.3 est la dernière génération de la famille GLM de Z.ai et marque une évolution vers des systèmes d’IA capables d’exécuter de manière autonome des tâches complexes de sécurité et d’ingénierie.
Cette annonce est particulièrement notable, car la cybersécurité n’est pas simplement présentée comme une catégorie de benchmark parmi d’autres. Z.ai utilise GLM-5.3 pour démontrer un système d’IA capable de découvrir des vulnérabilités logicielles et de participer à des flux de travail de développement d’attaques.
Reuters rapporte que Z.ai prévoit de publier le modèle publiquement après la finalisation des évaluations de sécurité, tandis que des capacités plus avancées seront initialement restreintes via un mécanisme d’accès de confiance.
Il s’agit d’un changement d’accent significatif par rapport à GLM-5.2.
GLM-5.2 était principalement positionné autour de l’ingénierie logicielle à long horizon et du codage agentique. La page de recherche de juin de Z.ai décrit GLM-5.2 comme « Conçu pour les tâches à long horizon ».
GLM-5.3 transpose cette philosophie agentique dans un domaine sensiblement plus sensible :
ingénierie logicielle → découverte de vulnérabilités → cyberdéfense → sécurité offensive contrôlée
Quelles sont les principales caractéristiques de GLM-5.3 ?
Raisonnement centré sur la cybersécurité
La capacité phare est la cybersécurité.
GLM-5.3 a obtenu :
84.5% sur CyberGym
CyberGym évalue la capacité d’un système d’IA à identifier des vulnérabilités logicielles. Le résultat dépasse légèrement les 83.8% rapportés de Mythos 5.
C’est important, car la cybersécurité nécessite plus que la génération de code syntaxiquement correct.
Un agent de sécurité compétent doit :
- Comprendre du code non familier.
- Identifier les surfaces d’attaque.
- Formuler des hypothèses sur les vulnérabilités.
- Retracer les flux de données et de contrôle.
- Valider l’hypothèse.
- Développer une preuve de concept appropriée.
- Déterminer si la vulnérabilité est réellement exploitable.
Le score CyberGym de GLM-5.3 suggère des progrès significatifs dans la première partie de cette chaîne.
Découverte de vulnérabilités performante
Le score CyberGym de 84.5% est sans doute le résultat précoce le plus impressionnant.
Il place GLM-5.3 légèrement devant Mythos 5 en identification de vulnérabilités :
| Modèle | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
La marge n’est que de 0.7 point de pourcentage, il serait donc trompeur de décrire GLM-5.3 comme décisivement supérieur.
Le point plus intéressant est qu’un modèle à poids ouverts de Z.ai entre dans le même voisinage de performance qu’un système de cybersécurité fortement restreint.
Le développement d’exploits reste un point faible
GLM-5.3 ne domine pas toutes les tâches de cybersécurité.
Sur ExploitBench :
| Modèle | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
Il s’agit d’un écart de 23.6 points.
Cela révèle une distinction importante :
Trouver une vulnérabilité n’est pas la même chose que l’exploiter de manière fiable.
GLM-5.3 semble très performant pour identifier des faiblesses, mais les premiers résultats indiquent que convertir ces constatations en développement d’exploits fiable reste nettement plus difficile.
Pour les équipes de sécurité d’entreprise, cela rend en fait le modèle intéressant en tant qu’assistant défensif d’analyse des vulnérabilités, plutôt que comme simple moteur d’automatisation offensive.
GLM-5.3 vs GLM-5.2
GLM-5.2 fournit la base confirmée la plus utile.
| Caractéristique | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Statut | Publié | Annoncé |
| Positionnement principal | Agents à long horizon | Cybersécurité + agents |
| Codage | Excellent | Devrait rester performant |
| Cybersécurité | Fort potentiel | Focalisation phare explicite |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| Contexte | 1M | Non confirmé |
| Paramètres | ~753B | Non confirmé |
| Licence | MIT | Poids ouverts annoncés |
| Tarification API | Publiée | Pas encore publiée |
| Poids publics | Disponibles | Planifiés |
L’architecture confirmée de GLM-5.2 est d’environ 753B paramètres, et son catalogue public de modèles répertorie toujours le modèle 753B et la version FP8.
GLM-5.2 a également atteint 81.0 sur Terminal-Bench 2.1 et 62.1 sur SWE-bench Pro, selon des rapports tiers basés sur les documents d’évaluation des modèles de Z.ai.
Mais ces chiffres doivent rester des benchmarks de GLM-5.2, et ne pas être attribués à GLM-5.3.
GLM-5.3 vs Mythos 5
C’est actuellement la comparaison de benchmarks la plus significative.
| Benchmark | GLM-5.3 | Mythos 5 | Différence |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
Le résultat conduit à une conclusion nuancée.
GLM-5.3 l’emporte sur l’identification des vulnérabilités.
Mais :
Mythos 5 reste nettement plus fort en développement d’exploits.
Par conséquent, dire « GLM-5.3 bat Mythos 5 » serait une interprétation inexacte des données disponibles.
Une meilleure description est :
GLM-5.3 atteint des performances de niveau Mythos 5 en découverte de vulnérabilités tout en restant en retrait sur le développement d’exploits.