autodl-research-pilot
AutoDL Research Pilot
AutoDL Research Pilot は、Codex に次の2つの問いに実用的に答える手段を提供します: この実験で今 GPU を借りるべきか、そして利用可能な GPU のうちどれを借りる価値があるか。
Enterprise Elastic ワークフローは、公式の AutoDL API から始まります。アカウント残高と、リージョン・CUDA・CPU・RAM・価格で絞り込まれた GPU 在庫を読み取り、トークンがアクセスできる場合はデプロイメントとプライベートイメージも追加します。スケジューラーは、そのライブな状態とワークロード固有のスループットの根拠を突き合わせ、総完了時間と総コストを比較し、正確な Container デプロイメント要求を作成します。その要求は、研究者が承認するまでローカルに保持されます。
時給が高いことは、自動的に高コストを意味しません。より速い GPU が30時間の実行を8時間に短縮できるなら、完了が早くなり、総コストも低くなる可能性があります。逆に、最上位の GPU はほとんどの時間を DataLoader の待機に費やしかねません。Research Pilot は製品名のランキングではなく、実行そのものをモデル化します。
機能
公式 API をコントロールプレーンとして使用します。 Enterprise の検出、計画、デプロイメント作成、一覧表示、停止、削除は、第一級の CLI および MCP 操作です。
可用性を実行可能にします。 在庫は、デプロイメントに設定される同じリージョン、CUDA、CPU/RAM、GPUモデル、
price_toフィルターで照会されます。実行全体を最適化します。 実行時間、セットアップ、転送、キューイング、ワークロードスループット、不確実性、既知の固定費が、1つのコスト/時間 Pareto 比較に投入されます。
研究の制約を理解します。 VRAM、予算、期限、在庫、実行準備状態はハードフィルターです。モデル、データ、精度、シード、バッチセマンティクス、評価は、より安いカードに合わせて暗黙に変更されません。
明確なプリファレンスを提供します。
economyは保守的な総コストを最小化し、timeは予算内で完了時間を最小化し、balancedは中間点を選び、customは独自の重みを受け入れます。有料アクションをレビュー可能に保ちます。 ミューテーションはデフォルトでリクエストプレビューです。確認済みの Elastic create は、API 呼び出しの直前に、ウォレット容量、重複する実行名、プライベートイメージへのアクセス/存在、全候補在庫、期限を再確認します。
CLI、MCP サーバー、Codex Skill として提供されます。 Skill はさらに、GPU 診断、ストレージ、イメージ、フォアグラウンドコマンド、チェックポイント、Pro/Elastic ライフサイクルの違いもカバーします。
Related MCP server: Run:AI MCP Server
クイックスタート: Enterprise Elastic
インストール
git clone https://github.com/chengxi271-commits/autodl-research-pilot.git
cd autodl-research-pilot
python -m venv .venvWindows PowerShell:
.\.venv\Scripts\Activate.ps1
python -m pip install -e ".[mcp]"
$env:AUTODL_TOKEN = "YOUR_TOKEN"Linux / macOS:
source .venv/bin/activate
python -m pip install -e '.[mcp]'
export AUTODL_TOKEN='YOUR_TOKEN'トークンはプロセス環境に保持します。このプロジェクトは、TOML、JSON、コマンド引数、ソース管理のいずれでもトークンを必要としません。
この実行を記述する
Enterprise の例をコピーし、イメージ、コマンド、リージョン、リソース範囲、ワークロード性能係数、価格上限を置き換えます:
cp examples/elastic.project.toml my-run.project.toml
cp examples/elastic.catalog.toml my-run.catalog.tomlカタログは意図的に小さくしています。それは、AutoDL がこれまでに提供してきたすべての GPU ではなく、使用する準備ができている GPU プロファイルを列挙します。image_source には、アカウントイメージには private を、AutoDL の API 付録の UUID には public を設定します。dc_list が複数のリージョンにまたがる場合は、記載されているすべてのリージョンに入出力ストレージを準備するか、リストを準備済みのリージョンに絞り込みます。各 performance_factor は、同じワークロードまたは明確にラベル付けされた推定値から取得してください。各 price_ceiling_cny は、主張された市場価格ではなく、あなたが許容できる最大の時間単価です。
検出、計画、プレビュー
autodl-pilot discover --catalog my-run.catalog.toml --output live-context.json
autodl-pilot live-plan --project my-run.project.toml --catalog my-run.catalog.toml --profile balanced --output run.plan.json
autodl-pilot apply-live-plan --plan run.plan.jsonlive-plan はデフォルトで新しい検出を実行するため、個別の discover コマンドはオプションです。これは、API が返した内容を確認したい場合や、議論のために読み取り専用スナップショットを1つ固定したい場合に役立ちます。
プレビューには、一意の実行名、正確な GPU、利用可能なリージョン、イメージとソース、フォアグラウンドコマンド、CPU/RAM 範囲、価格上限が含まれます。ミューテーション呼び出しは行いません。selected.execution_ready を確認してください。false の場合、selected.needs_input が、欠落しているアカウントアクセス、イメージ、または研究ゲートを指定します。実行準備が整ったリクエストを確認した後:
autodl-pilot apply-live-plan --plan run.plan.json --confirm確認時には、ウォレット、同じ実行名のアクティブなデプロイメント、選択したプライベートイメージ、すべてのカタログ在庫フィルターを再度読み取ります。保守的な実行時間が固定された期限に依然として収まることを確認してから、POST /api/v1/dev/deployment を呼び出します。選択したプロファイルが消えた場合、または以前は利用できなかった候補が出現した場合、古いランキングから作成したり、未承認の GPU に置き換えたりせず、計画に戻ります。
判断の仕組み
GPU プロファイル g について、スケジューラーは参照実行時間から始めて次を見積もります:
compute time = reference runtime / workload performance factor
total time = queue + setup + transfer + compute time
total cost = fixed cost + billed time × hourly price ceiling × GPU count信頼度の低い性能エビデンスは、保守的な時間とコストを拡大します。ハード制約を満たさない候補は、プロファイルのスコアリングに到達しません。生き残った候補は Pareto フロンティアを形成します。フロンティア上の候補で、別の候補より遅く、かつ高価なものはありません。
プロファイル | 選択ルール |
| 保守的な総コストが最小。時間でタイブレーク |
| コスト/時間のリグレット、デフォルト重み 45% / 55% |
| 予算内で最も短い保守的な完了時間 |
| プロジェクトポリシーに基づく正規化された重み |
API の在庫レスポンスは、アイドル状態のカード枚数を報告し、正確な価格やベンチマーク速度は報告しません。したがって Research Pilot は、これらの事実を分離して保持します:
AutoDL の在庫は、価格帯の下での現在の可用性を証明します。
カタログは VRAM とワークロード性能のエビデンスを記録します。
Elastic の
price_toはデプロイメントが受け入れる価格を上限で制限し、プランナーはその上限を保守的な請求額に使用します。
現在のライブプランナーは、意図的に1GPUの Container デプロイメントを作成します。AutoDL は在庫をシングルカードのクエリとして文書化し、2枚のアイドルカードが異なるホスト上にある可能性があると警告しています。マルチGPUスケジューリングは、楽観的な在庫の合計ではなく、同一ワークロードのスケーリングテストと明示的な同一ホストのエビデンスに従うべきです。
GPU 選択をより賢くする
AutoDL の公式性能表は有益な事前情報ですが、その実行はシングルカードで、合成のインメモリ入力を使用し、CPU 前処理と追加の I/O を省略しています。実際のモデル、精度、バッチセマンティクス、データパイプラインの短い部分を優先してください。
同梱の Skill は、単純なボトルネックのルールに従います:
GPU が 0%: デバイスの使用状況とフレームワーク/CUDA 互換性を確認します。
GPU がおおよそ 90% 超で安定: より高速な GPU、または測定済みのシングルホスト・マルチGPU実行が役立つ可能性があります。
GPU が低い、または変動: CPU、DataLoader ワーカー、ストレージ、同期を最初に調査します。
CUDA OOM: より大きな VRAM を決定する前に、古いプロセスとバッチサイズ 1 を確認します。
RAM 制限付近でプロセスが強制終了: より多くの VRAM ではなく、より多くのコンテナメモリを要求します。
同等の成功した実行の後、その計算時間、セットアップ/転送オーバーヘッド、実際のコンテナレート、測定されたボトルネックを、一致するカタログプロファイルにフィードバックします。そのワークロード履歴は、一般的なベンチマーク表ではなく、その後の選択を改善させます。
また、ストレージをスケジューリングの一部として扱います。ホットデータは /root/autodl-tmp に置きます。永続的なチェックポイントと結果は、Elastic コマンドが終了する前に、/root/autodl-fs などの永続ストレージに置きます。ソースにリンクされた運用ルールについては、AutoDL フィールドガイド を参照してください。
個人向け Pro アカウント
公式の Pro API は、ウォレット、インスタンス、ステータス、スナップショット、プライベートイメージを読み取ることができ、インスタンスの作成、電源オン/オフ、解放も実行できます。事前割り当てのマーケットカタログや在庫エンドポイントは公開していません。新しい Pro レンタルの場合は、オフラインプランナーで最新のコンソール見積もりを使用します:
autodl-pilot api wallet
autodl-pilot api instances
autodl-pilot api images
autodl-pilot plan --project project.toml --offers current-offers.toml --output pro.plan.json
autodl-pilot apply-plan --plan pro.plan.json現在の Pro スナップショットのドキュメントは、単位を宣言せずに生の payg_price フィールドを公開しているため、クライアントはそれらを生のまま保持します。長時間の実行の前に、コンソールで割り当てられた価格を確認してください。Pro API の作成は従量課金制で、1〜4基の GPU を受け付け、システムディスク拡張を公開します。API の電源オンは GPU モードに対応しており、コンソールのカードなしモードには対応していません。
元のオフラインの例は、トークンなしでスケジューラーをテストするのに引き続き役立ちます:
autodl-pilot plan --project examples/project.toml --offers examples/offers.toml --profile balancedその価格はフィクスチャであり、現在の見積もり実行ゲートを通過できません。
デプロイメントの運用
autodl-pilot api deployments
autodl-pilot api containers --payload '{"deployment_uuid":"DEPLOYMENT_UUID","page_index":1,"page_size":10}'
autodl-pilot api events --payload '{"deployment_uuid":"DEPLOYMENT_UUID","page_index":1,"page_size":10,"offset":0}'
autodl-pilot deployment-stop DEPLOYMENT_UUID
autodl-pilot deployment-stop DEPLOYMENT_UUID --confirm
autodl-pilot deployment-delete DEPLOYMENT_UUID
autodl-pilot deployment-delete DEPLOYMENT_UUID --confirmElastic のトレーニングはフォアグラウンドで実行する必要があります。cmd が終了するとコンテナは停止します。バックグラウンドの python train.py & は、課金とライフサイクルの動作を研究ジョブから切り離したままにする可能性があります。ローカルデータは停止後は永続しません。再利用しない場合は即座に解放されます。再利用キャッシュは残存物を保持する可能性がありますが、保証されたストレージでも再起動可能なコンテナでもありません。cmd_before_shutdown には5秒間のウィンドウしかないため、チェックポイントの永続化はトレーニングコマンド自体に含める必要があります。
SSH で起動する Pro の長時間実行では、screen、tmux、または Jupyter ターミナルを使用し、ログを名前付きファイルに書き込みます。release の前に結果を取得して検証してください。計算の停止と回復可能な状態の削除は、別々の判断です。
CLI リファレンス
コマンド | 目的 |
| Enterprise のウォレットと絞り込まれた在庫を読み取る。許可されていればデプロイメント/イメージも |
| 価格上限付きの Elastic プランを検出して選択する |
| Elastic デプロイメントをプレビューまたは確認する |
| 設定済みのローカル、既存、Pro の候補をオフラインで比較する |
| Pro 作成リクエストをプレビューまたは確認する |
| Python、トークン設定、オプションの API アクセスを確認する |
| ウォレット、Pro 状態、Elastic の在庫/イメージ/デプロイメント/コンテナ/イベントを読み取る |
| Pro ライフサイクル操作をプレビューまたは確認する |
| Elastic ライフサイクル操作をプレビューまたは確認する |
通常の結果と制御されたエラーはすべて JSON です。引数については autodl-pilot --help を実行してください。
Codex と MCP
mcp エクストラをインストールし、このリポジトリをローカルの Codex プラグインとして読み込みます。.mcp.json は Windows 向けで、docs/mcp.unix.json は Unix マニフェストです。MCP は、CLI と同じ検出、ライブプランニング、プレビュー、確認、読み取り、ライフサイクル操作を公開します。
Codex Skill は skills/autodl-research-pilot/SKILL.md にあります。役立つ最初のプロンプトは次のとおりです:
AutoDL API を使用してライブな Elastic 在庫を調べ、balanced モードで対応している GPU プロファイルを比較し、正確なデプロイメントプレビューを表示してください。作成する前に私の承認を待ってください。
スコープ
バージョン 0.2.0 は、APIファーストのEnterpriseシングルGPU Container パスを実装し、Pro/オフラインプランニングを維持します。APIクライアントはコントロールプレーンであり、SSH転送、ワークロード実行、メトリクス収集、チェックポイント取得は、Skillによって調整されるデータプレーンの作業として残ります。カタログフィードバックは、自動テレメトリではなく、Skillによってガイドされます。ランタイムコストには、fixed_cost として指定された場合にのみストレージが含まれます。購入済みのElastic期間パッケージ残高はまだモデル化されていないため、それを適用する場合、見積もりは限界現金コストを過大評価する可能性があります。
エンドポイントとユニットの境界は、AutoDL API Boundaries に文書化されています。これはコミュニティプロジェクトであり、AutoDLとは提携していません。
開発
python -m unittest discover -s tests -vCIは、Python 3.11、3.12、3.13でテストスイートを実行します。CONTRIBUTING.md、SECURITY.md、および課題トラッカーを参照してください。
ライセンス
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseCqualityDmaintenanceEnables interaction with the RunPod REST API to manage GPU pods, serverless endpoints, templates, network volumes, and container registry authentications through natural language.261MIT
- FlicenseAqualityDmaintenanceEnables LLM agents to control NVIDIA Run:AI infrastructure by dynamically searching and executing over 426 Run:AI APIs through MCP tools.411
- AlicenseNot gradedqualityBmaintenanceEnables ML researchers to manage experiments across local and remote AutoDL GPU instances, including experiment creation, training launch, run polling, and report writing via Claude Code.1MIT
- AlicenseNot gradedqualityCmaintenanceManages AutoDL GPU cloud instances, including lifecycle management, SSH operations, file transfer, and GPU monitoring.1MIT
Related MCP Connectors
A paid remote MCP for OpenAI Codex agent coordination MCP, built to return verdicts, receipts, usage
Operate Linux, macOS and Windows from your LLM. Every action runs through an auditable allowlist.
Pay-per-call agent superpowers: media/video gen, product demos, research, GTM, scraping, compute.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/chengxi271-commits/autodl-research-pilot'
If you have feedback or need assistance with the MCP directory API, please join our Discord server