Models/glm-4.5v

glm-4.5vActive · Cloud

Z.AI (Zhipu AI) · Released Aug 2025 · MIT

GLM-4.5V is a vision-language foundation model for multimodal agent applications. Built on a Mixture-of-Experts (MoE) architecture with 106B parameters and 12B activated parameters, it achieves state-of-the-art results in video understanding,...

Context
128K
Max output
32K
Input
$0.60
Output
$1.80
Cached in
-
Latency
-

Capabilities

Core
Streaming
Function calling
JSON mode
Structured outputs
Multimodal
Vision
Image input
Audio
Image generation
Video
Advanced
Reasoning
Tool calling
MCP
Prompt caching
Batch API
Embeddings

Details

ReleasedAug 2025
LicenseMIT
InputText
OutputText
Throughput-
Availability93.2%

Related models