Alibaba logo

Qwen3.5-4B

Multimodal
Alibaba

Qwen3.5-4B is a 4 billion parameter vision-language model using Gated DeltaNet hybrid architecture with a 3:1 ratio of linear attention to full softmax attention. It supports 262K native context length and delivers strong performance for its size across knowledge, reasoning, coding, and multilingual tasks.

Key Specifications

Parameters
4.0B
Context
-
Release Date
March 2, 2026
Average Score
64.4%

Timeline

Key dates in the model's history
Announcement
March 2, 2026
Last Update
September 10, 2026
Today
September 19, 2026

Technical Specifications

Parameters
4.0B
Training Tokens
-
Knowledge Cutoff
-
Family
-
Capabilities
MultimodalZeroEval

Benchmark Results

Model performance metrics across various tests and benchmarks

Reasoning

Logical reasoning and analysis
GPQA
Thinking modeSelf-reported
76.2%

Other Tests

Specialized benchmarks
AA-LCR
Thinking modeSelf-reported
57.0%
BFCL-V4
Thinking modeSelf-reported
50.3%
C-Eval
Thinking modeSelf-reported
85.1%
DeepPlanning
Thinking modeSelf-reported
17.6%
Global PIQA
Thinking modeSelf-reported
78.9%
HMMT 2025
February 2025Self-reported
74.0%
HMMT25
November 2025Self-reported
76.8%
IFBench
Thinking modeSelf-reported
59.2%
IFEval
Thinking modeSelf-reported
89.8%
Include
Thinking modeSelf-reported
71.0%
LiveCodeBench v6
Thinking modeSelf-reported
55.8%
LongBench v2
Thinking modeSelf-reported
50.0%
MAXIFE
Thinking modeSelf-reported
78.0%
MMLU-Pro
Thinking modeSelf-reported
79.1%
MMLU-ProX
Thinking modeSelf-reported
71.5%
MMLU-Redux
Thinking modeSelf-reported
88.8%
MMMLU
Thinking modeSelf-reported
76.1%
Multi-Challenge
Thinking modeSelf-reported
49.0%
NOVA-63
Thinking modeSelf-reported
54.3%
PolyMATH
Thinking modeSelf-reported
51.1%
SuperGPQA
Thinking modeSelf-reported
52.9%
t2-bench
Thinking modeSelf-reported
79.9%
VITA-Bench
Thinking modeSelf-reported
22.0%
WMT24++
Thinking modeSelf-reported
66.6%

License & Metadata

License
apache_2_0
Announcement Date
March 2, 2026
Last Updated
September 10, 2026

Similar Models

All Models

Recommendations are based on similarity of characteristics: developer organization, multimodality, parameter size, and benchmark performance. Choose a model to compare or go to the full catalog to browse all available AI models.