Z.ai: GLM-5.3-Flash

Chat
z-ai/glm-5.3-flash

GLM-5.3-Flash es el modelo ligero y de alta velocidad del sitio internacional de Z.ai (api.z.ai), lanzado el 2026-08-26. Acepta entrada multimodal nativa, incluidas imágenes y vídeo, y apunta a programación eficiente y tareas de agente de largo alcance. El modo de pensamiento está siempre activo y no puede desactivarse, pero el esfuerzo de razonamiento se elige entre low, high y max. Admite uso de herramientas, caché de prompts y búsqueda web. Ventana de contexto: 1M tokens, salida: 131K. Disponible mediante los protocolos compatible con OpenAI y Anthropic a través de Ofox.

Ventana de Contexto
1M
Tokens de Salida Máximos
131K
Lanzamiento
2026-08-26
Capacidades
VisiónFunction CallingRazonamientoPrompt CachingBúsqueda WebEntrada de Video
Proveedores Disponibles
VolcengineZ.ai
Protocolos Soportados
openaianthropic

Providers

Volcengine
Tokens de Entrada
$0.15/M
Tokens de Salida
$0.5/M
Lectura de Caché
$0.03/M
Búsqueda Web
$0.01/R
Protocols
openai/v1/chat/completions/v1/responses
anthropic
Z.ai
Tokens de Entrada
$0.15/M
Tokens de Salida
$0.5/M
Lectura de Caché
$0.03/M
Búsqueda Web
$0.01/R
Protocols
openai/v1/chat/completions
anthropic

Ejemplos de Código

from openai import OpenAI
client = OpenAI(
base_url="https://api.ofox.run/v1",
api_key="YOUR_OFOX_API_KEY",
)
response = client.chat.completions.create(
model="z-ai/glm-5.3-flash",
messages=[
{"role": "user", "content": "Hello!"}
],
)
print(response.choices[0].message.content)

Disponibilidad y estado

Preguntas Frecuentes

Z.ai: GLM-5.3-Flash en Ofox.ai cuesta $0.15/M por millón de tokens de entrada y $0.5/M por millón de tokens de salida. Pago por uso, sin cuotas mensuales.