Hugging Face、データセットのストリーミングを100倍効率化し、ダウンロード不要で大規模データセットの利用を可能に
Streaming datasets: 100x More Efficient
Hugging Faceは、`datasets`ライブラリのストリーミング機能を大幅に改善し、データセットのダウンロードなしにマルチテラバイト規模のデータセットを即座に利用可能にした。この改善により、リクエスト数が100分の1に削減され、データ解像度が10倍、サンプル/秒が2倍に向上し、256のワーカーが同時に接続してもクラッシュしないようになった。主な変更点として、データファイルリストの永続キャッシュ化によるスタートアップ時のリクエスト削減と、Parquetデータセットのプリフェッチおよび設定可能なバッファリングによるストリーミング中のスループット向上が挙げられる。これにより、大規模なモデルトレーニングにおけるデータロードのボトルネックが解消され、トレーニング時間が大幅に短縮される。Hugging FaceはXetストレージとParquet Content Defined Chunking (CDC) を活用し、データ転送の高速化と効率化を実現している。これらの新機能は`datasets`と`huggingface_hub`ライブラリに含まれており、`pip install --upgrade datasets huggingface_hub`で利用可能となる。
- Hugging Faceがdatasetsライブラリのストリーミング機能を大幅改善し、マルチテラバイト規模のデータセットをダウンロード不要で即時利用可能にした
Hugging Faceはデータセットストリーミングの大幅な効率化を発表した。本改善により、大規模AIモデルのトレーニングにおけるデータロードのボトルネックが解消され、トレーニング時間の短縮とインフラコスト削減が見込まれる。XetストレージとParquet CDC技術の活用でデータ転送効率を高めており、AI/ML領域におけるデータ基盤レイヤーの競争が激化する中、Hugging Faceのプラットフォームロックイン効果を強める可能性がある点に注目したい。