HF JobsでvLLMサーバーを1コマンドで立ち上げる方法
サマリー
HF Jobsを使って、簡単にvLLMサーバーを立ち上げる方法を解説します。コマンド一つでOpenAI互換のエンドポイントを作成し、どこからでもクエリを送信できます。サーバーの立ち上げ、クエリの送信、クリーンアップの手順を詳しく説明しています。
本文
HF Jobsを使用すると、1つのコマンドでプライベートなOpenAI互換のLLMエンドポイントを立ち上げることができます。サーバーのプロビジョニングやKubernetesの設定は不要で、使用した分だけの料金が発生します。サーバーが立ち上がったら、ノートパソコンやノートブックなど、どこからでもクエリを送信できます。これは、テストや評価、バッチ生成のためのモデルを迅速に立ち上げる最も簡単な方法です。以下に、サーバーの立ち上げからクエリの送信、クリーンアップまでの手順を説明します。
### 前提条件
- 支払い方法またはプラスのプリペイド残高
- `huggingface_hub >= 1.20.0`のインストール
- ローカルでのログイン
### サーバーの立ち上げ
以下のコマンドを実行します。
```bash
hf jobs run --flavor a10g-large --expose 8000 --timeout 2h
vllm/vllm-openai:latest
vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000
```
このコマンドを実行すると、サーバーが立ち上がり、URLが表示されます。サーバーが起動したら、数分待ってからクエリを送信できます。
### クエリの送信
vLLMはOpenAI APIに対応しており、リクエストにはHFトークンを使用します。最も簡単な方法は、以下のcurlコマンドを使用することです。
```bash
curl https://--8000.hf.jobs/v1/chat/completions
-H "Authorization: Bearer $(hf auth token)"
-H "Content-Type: application/json"
-d '{"model": "Qwen/Qwen3-4B", "messages": [{"role": "user", "content": "Hello!"}]}''
```
### クリーンアップ
ジョブは秒単位で課金されるため、作業が終わったらサーバーを停止します。以下のコマンドを実行します。
```bash
hf jobs cancel
```
このようにして、HF Jobsを利用して簡単にvLLMサーバーを立ち上げ、クエリを送信し、クリーンアップすることができます。
### 前提条件
- 支払い方法またはプラスのプリペイド残高
- `huggingface_hub >= 1.20.0`のインストール
- ローカルでのログイン
### サーバーの立ち上げ
以下のコマンドを実行します。
```bash
hf jobs run --flavor a10g-large --expose 8000 --timeout 2h
vllm/vllm-openai:latest
vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000
```
このコマンドを実行すると、サーバーが立ち上がり、URLが表示されます。サーバーが起動したら、数分待ってからクエリを送信できます。
### クエリの送信
vLLMはOpenAI APIに対応しており、リクエストにはHFトークンを使用します。最も簡単な方法は、以下のcurlコマンドを使用することです。
```bash
curl https://--8000.hf.jobs/v1/chat/completions
-H "Authorization: Bearer $(hf auth token)"
-H "Content-Type: application/json"
-d '{"model": "Qwen/Qwen3-4B", "messages": [{"role": "user", "content": "Hello!"}]}''
```
### クリーンアップ
ジョブは秒単位で課金されるため、作業が終わったらサーバーを停止します。以下のコマンドを実行します。
```bash
hf jobs cancel
```
このようにして、HF Jobsを利用して簡単にvLLMサーバーを立ち上げ、クエリを送信し、クリーンアップすることができます。