Models/qwen3-vl-8b-instruct

qwen3-vl-8b-instructActive · Inference

Fireworks AI · Released Oct 2025 · Apache-2.0

Qwen3-VL-8B-Instruct is a multimodal vision-language model from the Qwen3-VL series, built for high-fidelity understanding and reasoning across text, images, and video. It features improved multimodal fusion with Interleaved-MRoPE for long-horizon...

Context
4K
Max output
4K
Input
$0.20
Output
$0.20
Cached in
-
Latency
-

Capabilities

Core
Streaming
Function calling
JSON mode
Structured outputs
Multimodal
Vision
Image input
Audio
Image generation
Video
Advanced
Reasoning
Tool calling
MCP
Prompt caching
Batch API
Embeddings

Details

ProviderFireworks AI
ReleasedOct 2025
LicenseApache-2.0
InputText
OutputText
Throughput-
Availability99.7%

Related models