Z.ai: GLM-5.3-Flash

Chat
z-ai/glm-5.3-flash

GLM-5.3-Flash ist das leichtgewichtige, schnelle Modell der internationalen Z.ai-Site (api.z.ai), veröffentlicht am 2026-08-26. Es nimmt native multimodale Eingaben einschließlich Bildern und Video entgegen und zielt auf effizientes Coding und langlaufende Agentenaufgaben. Der Thinking-Modus ist dauerhaft aktiv und lässt sich nicht abschalten, der Reasoning Effort ist jedoch in den Stufen low, high und max wählbar. Unterstützt Werkzeugaufrufe, Prompt Caching und Websuche. Kontextfenster: 1M Tokens, Output: 131K. Verfügbar über OpenAI-kompatibles und Anthropic-Protocol über Ofox.

Kontextfenster
1M
Max. Ausgabe-Tokens
131K
Veröffentlicht
2026-08-26
Fähigkeiten
VisionFunction CallingReasoningPrompt CachingWebsucheVideo-Eingabe
Verfügbare Anbieter
VolcengineZ.ai
Unterstützte Protokolle
openaianthropic

Providers

Volcengine
Eingabe-Tokens
$0.15/M
Ausgabe-Tokens
$0.5/M
Cache-Lesen
$0.03/M
Websuche
$0.01/R
Protocols
openai/v1/chat/completions/v1/responses
anthropic
Z.ai
Eingabe-Tokens
$0.15/M
Ausgabe-Tokens
$0.5/M
Cache-Lesen
$0.03/M
Websuche
$0.01/R
Protocols
openai/v1/chat/completions
anthropic

Code-Beispiele

from openai import OpenAI
client = OpenAI(
base_url="https://api.ofox.run/v1",
api_key="YOUR_OFOX_API_KEY",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3-flash",
messages=[
{"role": "user", "content": "Hello!"}
],
)
print(response.choices[0].message.content)

Verfügbarkeit & Status

Häufig gestellte Fragen

Z.ai: GLM-5.3-Flash auf Ofox.ai kostet $0.15/M pro Million Eingabe-Tokens und $0.5/M pro Million Ausgabe-Tokens. Pay-as-you-go, keine monatlichen Gebühren.