WWDC 24: Core ML で Mistral 7B を実行する
WWDC 24: Running Mistral 7B with Core ML
Apple は WWDC 24 で発表された Core ML の新機能を用いて、70億パラメータを持つ Mistral 7B モデルをオンデバイスで効率的に実行する方法を解説しています。新機能には、Python の NumPy や PyTorch の Tensor に似た高レベルな抽象化を提供する新しい `MLTensor` 型、状態を効率的に管理するステートフルバッファ、そしてモデルサイズを大幅に削減するブロック単位の量子化(4ビット精度)が含まれます。これらの技術により、Mistral 7B モデルを約 3.8GB のメモリで Mac 上で実行可能になります。記事では、`swift-transformers` リポジトリのプレビュー版を使用し、モデルの変換、量子化、および実行手順を具体的に示しています。また、将来的な改善点として、Neural Engine の最適化や、`exporters` ツールの開発についても言及されています。
- Apple が WWDC 24 で Core ML の新機能(MLTensor、ステートフルバッファ、4ビットブロック量子化)を発表し、Mistral 7B をオンデバイスで実行可能にした
Apple が Core ML で Mistral 7B(70億パラメータ)をデバイス上実行可能にした点は、エッジAI民主化の観点で重要。特に、ブロック単位の4ビット量子化により3.8GBで動作する点は、PC/スマホへの大規模LLM搭載競争が本格化したことを示す。Apple のオンデバイスAI戦略がハードウェア(Neural Engine)とソフトウェア(Core ML・MLTensor)の両面で加速しており、今後のアプリエコシステムや半導体需要に波及する可能性があるため、投資家はAppleのAIスタック進捗と競合(Qualcomm、Google、Microsoft)との差分に注目すべき。