Hugging Face TransformersとHabana Gaudiを用いたBERTの事前学習方法
Pre-Train BERT with Hugging Face Transformers and Habana Gaudi
この記事では、Hugging Face TransformersライブラリとHabana Gaudi(AWS DL1インスタンス)を使用してBERTモデルをスクラッチから事前学習する方法を解説しています。まず、AWSアカウント、AWS CLI、IAMユーザーの設定といった要件を満たし、transformers、datasets、git-lfsをインストールします。次に、Hugging Face Hubにログインし、BookCorpusとWikipediaのデータセットをロードして結合し、カスタムトークナイザーをトレーニングしてHugging Face Hubにプッシュします。その後、データセットをトークン化し、チャンクに分割してHugging Face Hubにプッシュします。学習には、標準のTrainerの代わりにoptimum-habanaライブラリのGaudiTrainerとGaudiTrainingArgumentsを使用します。分散学習のためにrun_mlm.pyスクリプトを作成し、EC2RemoteRunnerを使用してAWS DL1インスタンス上で学習を実行します。ハイパーパラメータとして、モデル設定ID、データセットID、トークナイザーID、Gaudi設定ID、リポジトリID、学習ステップ数、バッチサイズ、学習率などを定義します。100,000ステップの学習には約12.5時間かかり、グローバルバッチサイズ256で約1,650ドルと見積もられています。これは、NVIDIA V100 GPUを使用したDeepSpeedチームの記録と比較して、コストが25%削減されるとされています。記事は、企業が自社言語やドメインに合わせたモデルを適応させることで精度を向上させられる可能性を示唆しています。
- Hugging Face Transformers と Habana Gaudi (AWS DL1) を使用し、BERT モデルをスクラッチから事前学習する手法が公開された。
- 100,000ステップのBERT事前学習が約12.5時間・約1,650ドルで完了し、NVIDIA V100を使用したDeepSpeed手法比でコスト25%削減と報告された。
本記事は、Habana Gaudiプロセッサ(Intel傘下)がBERT事前学習においてNVIDIA V100比で25%のコスト削減を達成した具体的なベンチマークを示しており、AIトレーニングインフラの競争構図に変化が生じつつある点が注目される。特にAWS DL1インスタンス上でHugging Faceエコシステムとシームレスに連携できる点は、企業が自社ドメイン向けにカスタムモデルを事前学習する際のハードルを下げる。IntelのHabana事業の成長性、およびNVIDIA寡占状態にあるAI半導体市場における代替選択肢の台頭という点で投資判断上重要なシグナルである。