About Video-MME
Definition and scoring
- Organisation
- Video-MME benchmark team
- Category
- Multimodal
- Version
- 2024
- Direction
- higher is better
- Ranking use
- Reference
- Contamination risk
- Unknown
A comprehensive benchmark for multimodal large language models on video understanding, covering temporal reasoning, perception, and question answering over videos. Every genuine source row stays tied to its exact model label, configuration, benchmark version and evaluation system. The summary chart shows one best compatible score per canonical product; Score 2.0 admits only explicitly mapped, frozen protocols and keeps incompatible configurations separate.
Open benchmark source ↗