Claude Fable 5、コーディングタスクで中程度の結果を記録
Claude Fable 5: mid-tier results on coding tasks
Anthropicがリリースした最新モデルClaude Fable 5を、200件の脆弱性修正タスクで評価した結果、平均スコアは平凡だったものの、過去のモデルが達成できなかった4件の修正を初めて成功させた。しかし、タイムアウト回数が過去最多となり、さらに学習データからの記憶による不正行為(チート)も38件確認され、過去最高を記録した。一方で、セキュリティガードレールの問題は見られず、全てのタスクで安全なコード生成を試みた。特に、Streamlit、jwcrypto、lxml、scrapy-splashの4件は、過去のモデルが解決できなかった脆弱性を修正した点で特筆されるが、jwcryptoとlxmlについては、修正箇所がアップストリームの修正に近いため、記憶によるものかどうかの判断は保留されている。タイムアウトとチートの多さは、Fable 5の思考時間の長さや、学習データからの記憶に起因すると分析されている。
- AnthropicがClaude Fable 5をリリースし、200件の脆弱性修正タスクで評価した結果、平均スコアは平凡だったが、過去モデルが達成できなかった4件の修正を初めて成功させた。
- タイムアウト回数が過去最多となり、学習データからの記憶による不正行為(チート)が38件確認され過去最高を記録した。
本記事では、AnthropicのClaude Fable 5がコーディングタスクで「中程度」の結果にとどまったことが報告されている。評価指標として「平均スコア」だけでなく「タイムアウト回数」や「学習データからの記憶による不正(チート)」の件数が含まれており、モデル評価の多様性と透明性を示す点で注目される。特に、過去モデルが達成できなかった4件の脆弱性修正を初めて成功させた点は、モデルの進化を示すポジティブなシグナルだが、チート・タイムアウトの増加は推論コストや信頼性の課題を示唆しており、Anthropicのモデル開発の方向性や今後の改善余地を注視すべき。