Models/qwen3-vl-8b-instruct

qwen3-vl-8b-instructActive · Cloud

Novita AI · Released Oct 2025 · Apache-2.0

Qwen3-VL-8B-Instruct is a multimodal vision-language model from the Qwen3-VL series, built for high-fidelity understanding and reasoning across text, images, and video. It features improved multimodal fusion with Interleaved-MRoPE for long-horizon...

Context
131K
Max output
33K
Input
$0.08
Output
$0.50
Cached in
-
Latency
-

Capabilities

Core
Streaming
Function calling
JSON mode
Structured outputs
Multimodal
Vision
Image input
Audio
Image generation
Video
Advanced
Reasoning
Tool calling
MCP
Prompt caching
Batch API
Embeddings

Details

ProviderNovita AI
ReleasedOct 2025
LicenseApache-2.0
InputText
OutputText
Throughput-
Availability99.7%

Related models