3LM: STEMとコードにおけるアラビア語LLMのベンチマーク
📚 3LM: A Benchmark for Arabic LLMs in STEM and Code
本研究では、STEM分野とコード生成におけるアラビア語大規模言語モデル(LLM)の性能を評価するための新しいベンチマーク「3LM(علم)」を導入する。3LMは、ネイティブSTEM(865件のMCQ)、合成STEM(1,744件のMCQ)、およびコード生成(HumanEval+とMBPP+の翻訳版)の3つのデータセットから構成される。ネイティブSTEMデータセットは、8~12年生のアラビア語教材から抽出された物理、化学、生物、数学、地理のMCQを含む。合成STEMデータセットは、より高度な推論能力を評価するために、LLMを活用した質問生成システムによって作成された。コード生成データセットは、アラビア語のプロンプトでアラビア語LLMをテストする初のコードデータセットである。評価の結果、Qwen2.5-72B-Instructがネイティブおよび合成STEMサブセットで最高性能(それぞれ71.8%、67.0%)を示し、Gemma-3-27BがSTEM回答の補完タスクで43.2%の精度を達成した。コード生成では、GPT-4oがHumanEval-ar(83.5% pass@1+)とMBPP-ar(63.6% pass@1+)で最高性能を示した。このベンチマークは、GitHubで公開されており、再現可能な評価を可能にする。
- アラビア語LLM向けベンチマーク「3LM(علم)」が公開された
- Qwen2.5-72B-InstructがネイティブSTEMと合成STEMで最高性能を達成
- GPT-4oがアラビア語コード生成ベンチマークHumanEval-arとMBPP-arで最高性能を達成
- Gemma-3-27BがSTEM回答補完タスクで43.2%の精度を達成
アラビア語LLMの性能評価ベンチマーク「3LM」が公開された。特にSTEM分野とコード生成において、Qwen2.5-72BやGPT-4oなどの汎用モデルがアラビア語特化モデルを上回る結果を示しており、中東市場におけるAIサービスの展開において、既存の汎用基盤モデルが十分に競争力を持つ可能性を示唆する。一方で、アラビア語ネイティブSTEM教材に基づく評価データセットの整備は、教育・政府調達向けのローカライズAI需要を捉える企業にとっては追い風となる。GitHub公開による再現可能な評価は、今後のモデル選定のベンチマークとして投資判断に有用。