A.I.AI
Artificial Analysis Intelligence Index v4.2がリリース、AA-BriefcaseとGDP.pdfを追加し、プライベートテストセットの重みを増加
Artificial Analysis Intelligence Index v4.2
YHacker News
AIが原文を翻訳・要約しています
Artificial Analysisは、AIモデルの評価指標であるIntelligence Indexのバージョン4.2をリリースしました。今回のアップデートでは、エージェント型知識作業の評価を行う「AA-Briefcase」と、4,592ページに及ぶPDF文書の長文コンテキスト推論を評価する「GDP.pdf」が新たに追加されました。また、モデルの不正行為(ゲーミング)を防ぐため、プライベートテストセットの重みが従来の4.1の20%から40%に倍増しました。これにより、Indexはより現実世界のユースケースに近づき、複雑で現実的なタスク評価が可能になりました。主要な結果として、AnthropicのClaude Fable 5.1がIndexをリードし、OpenAIのGPT-6 Astraがそれに続いています。コストパフォーマンスでは、Anthropic、OpenAI、Meta、Z.AIの4社がフロンティアを形成しています。GPT-6 Astraは、トークン効率においても優位性を示しています。
KEY POINTS要点記事から抽出した重要情報
- Artificial AnalysisがIntelligence Index v4.2をリリースし、エージェント型知識作業評価「AA-Briefcase」と4,592ページのPDF文書による長文コンテキスト推論評価「GDP.pdf」を新規追加した。
- プライベートテストセットの重みが従来の20%から40%に倍増され、モデルのベンチマークゲーミング対策が強化された。
- AnthropicのClaude Fable 5.1がIndexで首位、OpenAIのGPT-6 Astraが2位。コストパフォーマンスではAnthropic、OpenAI、Meta、Z.AIの4社がフロンティアを形成。
- GPT-6 Astraはトークン効率において優位性を示した。
CONTEXT文脈編集部による背景整理
AIモデルの評価指標であるIntelligence Indexの改訂と、その結果としてAnthropicとOpenAIの最新モデルがトップを争う構図は、フロンティアAI企業間の競争力の定点観測として投資判断上重要。特にプライベートテストセットの重みを倍増させたことで、ベンチマークゲーミングの影響を低減し実世界性能に近い評価が行われるようになった点は、モデル選択・投資検討の信頼性向上につながる。
原文を読むAnalyzed at 2026年9月5日 11:00