TimeScope: 長時間動画を理解する大規模マルチモーダルモデルの能力を測るベンチマーク
TimeScope: How Long Can Your Video Large Multimodal Model Go?
TimeScopeは、長時間の動画(1分〜8時間)におけるビジョン・言語モデルの理解度を測定するためのオープンソースベンチマークである。このベンチマークは、動画内に短い「ニードル」クリップを挿入し、局所的検索、情報統合、および詳細な時間的知覚の3つのスキルを評価する。多くの最先端モデルは、依然として真の時系列理解に苦労していることがTimeScopeによって明らかになった。特に、Gemini 2.5-Proは1時間以上の動画でも高い精度を維持する唯一のモデルであった。一方で、パラメータ数を増やしても必ずしも長時間の動画理解能力が向上するわけではないことも示された。TimeScopeは、モデルの能力が誇張されている可能性を指摘し、マルチモーダルシステムのトレーニングと評価方法の見直しを促す。
- 長時間動画理解のベンチマークTimeScopeがオープンソース公開された
TimeScopeベンチマークは、長時間動画理解におけるモデル性能の実態を可視化し、マルチモーダルAIの真の進捗を評価する指標として注目に値する。Gemini 2.5-Proが唯一1時間超の動画で高精度を維持した点は、Googleの大規模マルチモーダルモデルが競合に対して優位性を持つ可能性を示唆する。また、パラメータ数増加と長時間理解能力が相関しないという知見は、今後のモデルアーキテクチャや学習方法の方向性に影響を与えうる。ベンチマーク自体がオープンソースで公開されている点もエコシステムへの貢献として評価できる。