O DeepSeek V4 Flash é um modelo Mixture-of-Experts otimizado para eficiência da DeepSeek, lançado em 2026-04-24, com 284B de parâmetros totais e 13B de parâmetros ativados. Foi projetado para inferência rápida e cargas de alta taxa de transferência, mantendo forte desempenho em raciocínio e programação. Suporta uso de ferramentas (function calling) e cache de prompts. Janela de contexto: 1M tokens, saída: 384K. Preços: $0.14/M tokens de entrada e $0.28/M de saída, com leituras de cache a $0.0028/M, o que o torna adequado para tráfego de produção em grande volume. Disponível pelos protocolos OpenAI e Anthropic.
Providers
/v1/chat/completions/v1/responses/v1/chat/completionsExemplos de Código
from openai import OpenAIclient = OpenAI(base_url="https://api.ofox.run/v1",api_key="YOUR_OFOX_API_KEY",)response = client.chat.completions.create(model="deepseek/deepseek-v4-flash",messages=[{"role": "user", "content": "Hello!"}],)print(response.choices[0].message.content)
Disponibilidade e status
Benchmarks
DeepSeek V4 Flash obtém 1438 na categoria geral do ranking de texto do LMArena (controle de estilo), ficando em 70º de 374 modelos com base em 41.568 votos de preferência humana (atualizado em 2026-07-12).
| Categoria | Pontuação Arena | IC de 95% | Posição | Votos |
|---|---|---|---|---|
| Geral | 1433–1442 | 70º de 374 | 41.568 | |
| Prompts difíceis | 1455–1466 | 65º de 374 | 27.503 | |
| Programação | 1476–1489 | 71º de 369 | 12.085 | |
| Matemática | 1414–1441 | 78º de 362 | 2.133 | |
| Escrita criativa | 1401–1418 | 65º de 372 | 6.649 | |
| Seguimento de instruções | 1423–1436 | 66º de 374 | 13.952 | |
| Chinês | 1460–1489 | 73º de 344 | 2.014 |
Fonte: LMArena · CC BY 4.0 · Atualizado em 2026-07-12 · Metodologia ↗ · As posições comparam modelos dentro de cada categoria do ranking de texto do LMArena (controle de estilo). As pontuações vêm de avaliações de preferência humana de terceiros, não da OFOX.