Qwen Flash

Chat
qwen/qwen-flash

Qwen Flash est le modèle le plus rapide et le moins coûteux de la famille Qwen d'Alibaba, servi via Dashscope et conçu pour les tâches sensibles à la latence. Il offre une inférence ultrarapide tout en prenant en charge l'appel d'outils (function calling), la mise en cache des prompts et la recherche web. Fenêtre de contexte : 1M tokens, sortie : 32K. Cette fenêtre de 1M tokens lui permet de parcourir de longs documents en une seule passe, et la mise en cache des prompts garde les instructions répétées peu coûteuses dans les pipelines à fort volume. Disponible via les protocoles OpenAI et Anthropic.

Fenêtre de contexte
1M
Tokens de sortie max
32K
Publié
2025-07-28
Capacités
Function CallingPrompt CachingRecherche web
Fournisseurs disponibles
Aliyunalicloud
Protocoles supportés
openaianthropic

Providers

alicloud
Tokens d'entrée
$0.022/M
Tokens de sortie
$0.22/M
Lecture cache
$0.0043/M
Écriture cache
$0.027/M
Recherche web
$0.01/R
Protocols
openai/v1/chat/completions/v1/responses
anthropic
Aliyun
Tokens d'entrée
$0.022/M
Tokens de sortie
$0.22/M
Lecture cache
$0.0043/M
Écriture cache
$0.027/M
Recherche web
$0.01/R
Protocols
openai/v1/chat/completions/v1/responses
anthropic

Exemples de code

from openai import OpenAI
client = OpenAI(
base_url="https://api.ofox.run/v1",
api_key="YOUR_OFOX_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen-flash",
messages=[
{"role": "user", "content": "Hello!"}
],
)
print(response.choices[0].message.content)

Questions fréquentes

Qwen Flash sur Ofox.ai coûte $0.022/M par million de tokens d'entrée et $0.22/M par million de tokens de sortie. Paiement à l'usage, sans frais mensuels.