MiMo-V2-Omni
MultimodalMiMo-V2-Omni is Xiaomi's omni foundation model uniting frontier multimodal understanding with strong agentic capability. It fuses dedicated image, video, and audio encoders into a single shared backbone, processing all modalities simultaneously. Natively supports structured tool calling, function execution, and UI grounding. Supports over 10 hours of continuous audio understanding and 256K token context window. It is served by xiaomi with a 256K-token context window at $0.4 / $2 per 1M input/output tokens.
Key Specifications
Timeline
Technical Specifications
Pricing & Availability
Benchmark Results
Model performance metrics across various tests and benchmarks
Programming
Other Tests
License & Metadata
Similar Models
All ModelsMiMo-V2.5
Xiaomi
MiMo-V2.6-Pro
Xiaomi
MiMo-V2.6-Flash
Xiaomi
MiMo-V2-Pro
Xiaomi
GLM-5V-Turbo
Zhipu AI
Sakana Namazu
Sakana AI
GPT-5.2 Codex
OpenAI
GPT-5.1 Codex
OpenAI
Recommendations are based on similarity of characteristics: developer organization, multimodality, parameter size, and benchmark performance. Choose a model to compare or go to the full catalog to browse all available AI models.