AI ランタイム CLI の例

次の例は、airを使用して air run -f <config>.yaml CLI から送信する完全なエンドツーエンドのワークロードです。 それぞれにワークロードのYAML、任意のブートストラップスクリプト、そして完全なコードが含まれています。 前に実行を送信したことがない場合は、 クイックスタート から始めます。

Example Description
FSDP を使用したマルチノード LLM の微調整 torchrunと PyTorch 完全シャード データ並列 (FSDP) を使用して、16 個の H100 GPU (2 ノード) にわたって Llama-3.1-8B の微調整を監視しました。 MLflow にログを記録し、Unity Catalog ボリュームにチェックポイントを保存します。
レイ、こんにちは、世界 Ray Core、Ray Train、Ray Data、Ray Tuneの最低限の動作例であり、AIランタイム上でRayクラスタを実行するための共有ブートストラップパターンも含まれています。
Ray Train を使用した分散トレーニング 単一ノード上の 8 個の H100 GPU で、GPU ごとに 1 つのワーカーを使用して、Ray Train の TorchTrainer による分散データ並列微調整。
Ray Data と vLLM を使用したバッチ推論 単一ノード上の 8 つの H100 GPU で Ray Data と vLLM を使用したオフライン LLM バッチ推論。GPU ごとに 1 つの vLLM レプリカを実行し、Parquet として Unity カタログ ボリュームに結果を書き込みます。
レイチューンによるハイパーパラメータ探索 4つの1xA10ノードでRay Tuneを用いてQwen2.5-0.5BのLoRAハイパーパラメータ検索を行い、GPUごとに1回のトライアルを実行し、ASHAスケジューラでパフォーマンス不振のトライアルを早期に停止します。