DeepSeek V4 Flash est un modèle Mixture-of-Experts optimisé pour l'efficacité, signé DeepSeek et lancé le 2026-04-24, avec 284B de paramètres au total et 13B de paramètres activés. Il est conçu pour une inférence rapide et des charges à haut débit, tout en conservant de solides capacités de raisonnement et de génération de code. Il prend en charge l'appel d'outils (function calling) et la mise en cache des prompts. Fenêtre de contexte : 1M tokens, sortie : 384K. Tarifs : $0.14/M tokens en entrée et $0.28/M en sortie, lecture en cache à $0.0028/M, ce qui convient parfaitement aux trafics de production importants. Disponible via les protocoles OpenAI et Anthropic.
Providers
/v1/chat/completions/v1/responses/v1/chat/completionsExemples de code
from openai import OpenAIclient = OpenAI(base_url="https://api.ofox.run/v1",api_key="YOUR_OFOX_API_KEY",)response = client.chat.completions.create(model="deepseek/deepseek-v4-flash",messages=[{"role": "user", "content": "Hello!"}],)print(response.choices[0].message.content)
Disponibilité et état
Benchmarks
DeepSeek V4 Flash obtient 1438 dans la catégorie générale du classement texte LMArena (contrôle de style), se classant 70e sur 374 modèles sur la base de 41 568 votes de préférence humaine (mis à jour le 2026-07-12).
| Catégorie | Score Arena | IC à 95 % | Rang | Votes |
|---|---|---|---|---|
| Général | 1433–1442 | 70e sur 374 | 41 568 | |
| Prompts difficiles | 1455–1466 | 65e sur 374 | 27 503 | |
| Programmation | 1476–1489 | 71e sur 369 | 12 085 | |
| Mathématiques | 1414–1441 | 78e sur 362 | 2 133 | |
| Écriture créative | 1401–1418 | 65e sur 372 | 6 649 | |
| Suivi d'instructions | 1423–1436 | 66e sur 374 | 13 952 | |
| Chinois | 1460–1489 | 73e sur 344 | 2 014 |
Source : LMArena · CC BY 4.0 · Mis à jour le 2026-07-12 · Méthodologie ↗ · Les rangs comparent les modèles au sein de chaque catégorie du classement texte LMArena (contrôle de style). Les scores proviennent d'évaluations de préférence humaine tierces, et non d'OFOX.