Z.ai: GLM-5.3-Flash

Chat
z-ai/glm-5.3-flash

GLM-5.3-Flash est le modèle léger et rapide du site international de Z.ai (api.z.ai), sorti le 2026-08-26. Il accepte une entrée multimodale native, images et vidéos comprises, et vise le codage efficace et les tâches d'agent de long terme. Le mode réflexion est toujours actif et ne peut pas être désactivé, mais l'effort de raisonnement se choisit parmi low, high et max. Il prend en charge l'appel d'outils, la mise en cache des prompts et la recherche web. Fenêtre de contexte : 1M tokens, sortie : 131K. Disponible via les protocoles compatible OpenAI et Anthropic chez Ofox.

Fenêtre de contexte
1M
Tokens de sortie max
131K
Publié
2026-08-26
Capacités
VisionFunction CallingRaisonnementPrompt CachingRecherche webEntrée vidéo
Fournisseurs disponibles
Z.aiVolcengine
Protocoles supportés
openaianthropic

Providers

Volcengine
Tokens d'entrée
$0.15/M
Tokens de sortie
$0.5/M
Lecture cache
$0.03/M
Recherche web
$0.01/R
Protocols
openai/v1/chat/completions/v1/responses
anthropic
Z.ai
Tokens d'entrée
$0.15/M
Tokens de sortie
$0.5/M
Lecture cache
$0.03/M
Recherche web
$0.01/R
Protocols
openai/v1/chat/completions
anthropic

Exemples de code

from openai import OpenAI
client = OpenAI(
base_url="https://api.ofox.run/v1",
api_key="YOUR_OFOX_API_KEY",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3-flash",
messages=[
{"role": "user", "content": "Hello!"}
],
)
print(response.choices[0].message.content)

Disponibilité et état

Questions fréquentes

Z.ai: GLM-5.3-Flash sur Ofox.ai coûte $0.15/M par million de tokens d'entrée et $0.5/M par million de tokens de sortie. Paiement à l'usage, sans frais mensuels.