Alibaba logo

Qwen3 VL 32B Thinking

Multimodal
Alibaba

Qwen3-VL is a large multimodal model combining vision, language, and reasoning to achieve human-level perception and cognitive abilities. The 33B parameter Thinking version leads in multimodal reasoning and STEM tasks with OCR support, video understanding, and agentic interaction.

Key Specifications

Parameters
33.0B
Context
-
Release Date
September 21, 2025
Average Score
74.6%

Timeline

Key dates in the model's history
Announcement
September 21, 2025
Last Update
February 17, 2026
Today
September 10, 2026

Technical Specifications

Parameters
33.0B
Training Tokens
-
Knowledge Cutoff
-
Family
-
Capabilities
MultimodalZeroEval

Benchmark Results

Model performance metrics across various tests and benchmarks

General Knowledge

Tests on general knowledge and understanding
MMLU
Self-reported by the model providerSelf-reported
88.7%

Reasoning

Logical reasoning and analysis
GPQA
Self-reported by the model providerSelf-reported
73.1%

Multimodal

Working with images and visual data
AI2D
TESTSelf-reported
88.9%

Other Tests

Specialized benchmarks
OCRBench
Self-reported
85.5%
MM-MT-Bench
Self-reported
83.0%
DocVQAtest
Self-reported
96.0%
ScreenSpot
Self-reported
96.0%
MMLU-Redux
Self-reported
92.0%
MMBench-V1.1
EN_V1.1Self-reported
91.0%
AIME 2025
Self-reported by the model providerSelf-reported
83.7%
AndroidWorld_SR
Self-reported by the model providerSelf-reported
63.7%
Arena-Hard v2
Self-reported by the model providerSelf-reported
60.5%
BFCL-v3
Self-reported by the model providerSelf-reported
71.7%
BLINK
Self-reported by the model providerSelf-reported
68.5%
CharadesSTA
Self-reported by the model providerSelf-reported
62.8%
CharXiv-D
Self-reported by the model providerSelf-reported
90.2%
CharXiv-R
Self-reported by the model providerSelf-reported
65.2%
Creative Writing v3
Self-reported by the model providerSelf-reported
83.3%
ERQA
Self-reported by the model providerSelf-reported
52.3%
Hallusion Bench
Self-reported by the model providerSelf-reported
67.4%
IFEval
Self-reported by the model providerSelf-reported
87.8%
Include
Self-reported by the model providerSelf-reported
76.3%
InfoVQAtest
Self-reported by the model providerSelf-reported
89.2%
LiveBench 20241125
Self-reported by the model providerSelf-reported
74.7%
LiveCodeBench v6
Self-reported by the model providerSelf-reported
65.6%
LVBench
Self-reported by the model providerSelf-reported
62.6%
MathVision
Self-reported by the model providerSelf-reported
70.2%
MathVista-Mini
testminiSelf-reported
85.9%
MMLU-Pro
Self-reported by the model providerSelf-reported
82.1%
MMLU-ProX
Self-reported by the model providerSelf-reported
77.2%
MMMU-Pro
fullSelf-reported
68.1%
MMMU (val)
Self-reported by the model providerSelf-reported
78.1%
MMStar
Self-reported by the model providerSelf-reported
79.4%
MuirBench
Self-reported by the model providerSelf-reported
80.3%
Multi-IF
Self-reported by the model providerSelf-reported
78.0%
MVBench
Self-reported by the model providerSelf-reported
73.2%
OCRBench-V2 (en)
Self-reported by the model providerSelf-reported
68.4%
OCRBench-V2 (zh)
Self-reported by the model providerSelf-reported
62.1%
OSWorld
Self-reported by the model providerSelf-reported
41.0%
PolyMATH
Self-reported by the model providerSelf-reported
52.0%
RealWorldQA
Self-reported by the model providerSelf-reported
78.4%
ScreenSpot Pro
Self-reported by the model providerSelf-reported
57.1%
SimpleQA
Self-reported by the model providerSelf-reported
55.4%
SuperGPQA
Self-reported by the model providerSelf-reported
59.0%
VideoMME w/o sub.
Self-reported by the model providerSelf-reported
77.3%
VideoMMMU
Self-reported by the model providerSelf-reported
79.0%
WritingBench
Self-reported by the model providerSelf-reported
86.2%

License & Metadata

License
apache-2.0
Announcement Date
September 21, 2025
Last Updated
February 17, 2026

Similar Models

All Models

Recommendations are based on similarity of characteristics: developer organization, multimodality, parameter size, and benchmark performance. Choose a model to compare or go to the full catalog to browse all available AI models.