アラビア語LLM評価のためのリーダーボード、AraGen、および指示追従ベンチマークのアップデート
Arabic Leaderboards: Introducing Arabic Instruction Following, Updating AraGen, and More
MBZUAIとの協力により、アラビア語AI評価を統合する「Arabic-Leaderboards Space」がローンチされた。このプラットフォームは現在、AraGen-03-25とArabic Instruction Followingをサポートしており、将来的には様々なモダリティのアラビア語AIモデルのリーダーボードに拡張される予定である。AraGen 03-25は改善と更新されたベンチマークと共にリリースされ、データセットは340ペアの質問と回答に拡張された。また、アラビア語での指示追従能力を評価する初の公開ベンチマークであるArabic IFEval Benchmarkを搭載したInstruction Followingリーダーボードも提供される。AraGenの評価では、システムプロンプトとデータセットの更新がモデルのランキングに影響を与えることが示されたが、全体的な評価フレームワークは安定している。Arabic IFEvalは、英語のIFEvalデータセットを基に、アラビア語の言語的ニュアンスや文化的文脈に合わせて約300のプロンプトを適応・拡張して構築された。このベンチマークは、プロンプトレベルの厳密な精度を重視してモデルを評価し、アラビア語と英語の両方での指示追従能力を比較する。評価対象には、GPTシリーズやClaudeモデルなどのクローズドソースモデル、JaisシリーズやLLaMA-2などのオープンソースモデルが含まれる。
- MBZUAIとの協力によりアラビア語AI評価を統合するArabic-Leaderboards Spaceがローンチされた
- アラビア語の指示追従能力を評価する初の公開ベンチマークArabic IFEval Benchmarkが搭載された
- AraGenベンチマークが更新され、データセットが340ペアの質問と回答に拡張された
アラビア語AIモデルの評価基盤が整備された点は注目に値する。GPTやClaudeなどのクローズドモデルとJaisやLLaMAなどのオープンモデルが同一ベンチマークで比較可能になることで、アラビア語市場向けAIモデルの実力差が可視化される。特にアラビア語は中東・北アフリカの4億人以上の話者を持つ大市場だが、英語や中国語に比べてAI評価が遅れており、この分野への投資判断材料が増えることはポジティブ。MBZUAI(アブダビ)が主導している点から、中東におけるAIエコシステムの育成が加速する可能性があり、関連スタートアップへの投資機会につながる可能性がある。