Models/qwen3-vl-32b-instruct

qwen3-vl-32b-instructActive · Cloud

Dashscope · Released Oct 2025 · Apache-2.0

Qwen3-VL-32B-Instruct is a large-scale multimodal vision-language model designed for high-precision understanding and reasoning across text, images, and video. With 32 billion parameters, it combines deep visual perception with advanced text...

Context
131K
Max output
33K
Input
$0.16
Output
$0.64
Cached in
-
Latency
-

Capabilities

Core
Streaming
Function calling
JSON mode
Structured outputs
Multimodal
Vision
Image input
Audio
Image generation
Video
Advanced
Reasoning
Tool calling
MCP
Prompt caching
Batch API
Embeddings

Details

ProviderDashscope
ReleasedOct 2025
LicenseApache-2.0
InputText
OutputText
Throughput-
Availability100%

Related models