Skip to main content
Glama

AutoDL Research Pilot

AutoDL Research Pilot는 Codex가 두 가지 질문에 실용적으로 답할 수 있는 방법을 제공합니다: 이 실험이 지금 GPU를 임대해야 하는지, 그리고 어떤 사용 가능한 GPU를 임대할 가치가 있는지?

Enterprise Elastic 워크플로는 공식 AutoDL API로 시작합니다. 계정 잔액과 지역, CUDA, CPU, RAM, 가격으로 필터링된 GPU 재고를 읽으며, 토큰이 접근할 수 있을 때 배포와 프라이빗 이미지가 추가됩니다. 스케줄러는 해당 실시간 상태를 워크로드별 처리량 증거와 결합하고, 총 완료 시간과 총 비용을 비교하여 정확한 Container 배포 요청을 구성합니다. 요청은 연구자가 승인할 때까지 로컬에 유지됩니다.

시간당 요금이 높다고 해서 자동으로 비싼 것은 아닙니다. 더 빠른 GPU가 30시간 실행을 8시간으로 줄인다면 더 일찍 끝나고 전체 비용이 더 낮을 수 있습니다. 반대로 최상위 GPU는 대부분의 시간을 DataLoader를 기다리며 보낼 수 있습니다. Research Pilot은 제품 이름을 순위 매기는 대신 실행을 모델링합니다.

기능

  • 공식 API를 컨트롤 플레인으로 사용합니다. Enterprise 검색, 계획, 배포 생성, 목록 조회, 중지, 삭제는 일급 CLI 및 MCP 작업입니다.

  • 가용성을 실행 가능하게 만듭니다. 재고는 배포에 설정된 것과 동일한 지역, CUDA, CPU/RAM, GPU 모델, price_to 필터로 조회됩니다.

  • 전체 실행을 최적화합니다. 런타임, 설정, 전송, 대기열 대기, 워크로드 처리량, 불확실성, 알려진 고정 비용이 하나의 비용/시간 Pareto 비교에 투입됩니다.

  • 연구 제약 조건을 이해합니다. VRAM, 예산, 마감 기한, 재고, 실행 준비 상태는 하드 필터입니다. 모델, 데이터, 정밀도, 시드, 배치 의미론, 평가는 더 저렴한 카드에 맞게 조용히 바뀌지 않습니다.

  • 명확한 선호 옵션을 제공합니다. economy는 보수적 총비용을 최소화하고, time은 예산 내에서 완료 시간을 최소화하며, balanced는 중간 지점을 선택하고, custom은 사용자 정의 가중치를 허용합니다.

  • 유료 작업을 검토 가능하게 유지합니다. 변형(mutation) 작업은 기본적으로 요청 미리보기입니다. 확인된 Elastic 생성은 API 호출 직전에 지갑 용량, 중복 실행 이름, 프라이빗 이미지 접근/존재, 전체 후보 재고, 마감 기한을 다시 확인합니다.

  • CLI, MCP 서버, Codex Skill로 제공됩니다. Skill은 GPU 진단, 스토리지, 이미지, 포그라운드 명령, 체크포인트, Pro/Elastic 수명주기 차이도 다룹니다.

Related MCP server: Run:AI MCP Server

빠른 시작: Enterprise Elastic

설치

git clone https://github.com/chengxi271-commits/autodl-research-pilot.git
cd autodl-research-pilot
python -m venv .venv

Windows PowerShell:

.\.venv\Scripts\Activate.ps1
python -m pip install -e ".[mcp]"
$env:AUTODL_TOKEN = "YOUR_TOKEN"

Linux / macOS:

source .venv/bin/activate
python -m pip install -e '.[mcp]'
export AUTODL_TOKEN='YOUR_TOKEN'

토큰을 프로세스 환경에 유지하세요. 프로젝트는 TOML, JSON, 명령 인수, 소스 제어에 토큰을 절대 필요로 하지 않습니다.

이 실행 설명

Enterprise 예제를 복사하고 이미지, 명령, 지역, 리소스 상한, 워크로드 성능 요소, 가격 상한을 교체하세요:

cp examples/elastic.project.toml my-run.project.toml
cp examples/elastic.catalog.toml my-run.catalog.toml

카탈로그는 의도적으로 작습니다. AutoDL이 지금까지 제공한 모든 GPU가 아니라 사용할 준비가 된 GPU 프로필을 나열합니다. 계정 이미지에는 image_sourceprivate으로, AutoDL API 부록의 UUID에는 public으로 설정하세요. dc_list가 여러 지역에 걸쳐 있으면 모든 나열된 지역에 입출력 스토리지를 준비하거나 목록을 준비된 지역으로 좁히세요. 각 performance_factor는 동일한 워크로드 또는 명확히 표시된 추정치에서 나와야 하며, 각 price_ceiling_cny는 주장된 시장 견적이 아니라 허용 가능한 최대 시간당 가격입니다.

검색, 계획, 미리보기

autodl-pilot discover --catalog my-run.catalog.toml --output live-context.json

autodl-pilot live-plan --project my-run.project.toml --catalog my-run.catalog.toml --profile balanced --output run.plan.json

autodl-pilot apply-live-plan --plan run.plan.json

live-plan은 기본적으로 새 검색을 수행하므로 별도의 discover 명령은 선택 사항입니다. API가 반환한 내용을 검사하거나 논의를 위해 읽기 전용 스냅샷 하나를 고정하려는 경우 유용합니다.

미리보기에는 고유 실행 이름, 정확한 GPU, 사용 가능한 지역, 이미지 및 소스, 포그라운드 명령, CPU/RAM 범위, 가격 상한이 포함됩니다. 변형 호출은 하지 않습니다. selected.execution_ready를 확인하세요. false이면 selected.needs_input이 누락된 계정 접근, 이미지 또는 연구 게이트를 지정합니다. 실행 준비가 된 요청을 검토한 후:

autodl-pilot apply-live-plan --plan run.plan.json --confirm

확인 단계에서는 지갑, 동일한 실행 이름의 활성 배포, 선택한 프라이빗 이미지, 모든 카탈로그 재고 필터를 다시 읽습니다. 보수적 런타임이 고정된 마감 기한에 여전히 맞는지 확인한 후 POST /api/v1/dev/deployment를 호출합니다. 선택한 프로필이 사라지거나 이전에 사용할 수 없던 후보가 나타나면 오래된 순위에서 생성하거나 승인되지 않은 GPU로 대체하는 대신 계획 단계로 돌아갑니다.

결정 방식

GPU 프로필 g에 대해 스케줄러는 기준 런타임에서 시작하여 다음을 추정합니다:

compute time = reference runtime / workload performance factor
total time   = queue + setup + transfer + compute time
total cost   = fixed cost + billed time × hourly price ceiling × GPU count

신뢰도가 낮은 성능 증거는 보수적 시간과 비용을 늘립니다. 하드 제약 조건을 놓친 후보는 프로필 점수 산정에 도달하지 못합니다. 생존자들은 Pareto 프론티어를 형성합니다. 프론티어 후보 중 다른 후보보다 느리면서 동시에 더 비싼 경우는 없습니다.

프로필

선택 규칙

economy

가장 낮은 보수적 총비용, 동률 시 시간으로 결정

balanced

비용/시간 회귀, 기본 가중치 45% / 55%

time

예산 내에서 가장 짧은 보수적 완료 시간

custom

프로젝트 정책의 정규화된 가중치

API 재고 응답은 유휴 카드 수를 보고하며 정확한 가격이나 벤치마크 속도는 보고하지 않습니다. 따라서 Research Pilot은 다음 사실을 분리하여 유지합니다:

  1. AutoDL 재고는 가격 범위 내 현재 가용성을 증명합니다.

  2. 카탈로그는 VRAM 및 워크로드 성능 증거를 기록합니다.

  3. Elastic price_to는 배포가 수용할 수 있는 상한을 설정하며, 플래너는 보수적 비용 계산에 그 상한을 사용합니다.

현재 라이브 플래너는 의도적으로 단일 GPU Container 배포를 생성합니다. AutoDL은 재고를 단일 카드 쿼리로 문서화하고 두 개의 유휴 카드가 서로 다른 호스트에 있을 수 있다고 경고합니다. 멀티 GPU 스케줄링은 낙관적 재고 합계보다는 동일 워크로드 확장 테스트와 명시적 동일 호스트 증거를 따라야 합니다.

GPU 선택을 더 현명하게 만들기

AutoDL 공식 성능 표는 유용한 사전 지식이지만, 그 실행은 단일 카드이고 합성 인메모리 입력을 사용하며 CPU 전처리와 추가 I/O를 생략합니다. 실제 모델, 정밀도, 배치 의미론, 데이터 파이프라인의 짧은 조각을 우선 사용하세요.

번들된 Skill은 간단한 병목 현상 규칙을 따릅니다:

  • GPU 0%: 장치 사용량과 프레임워크/CUDA 호환성을 확인하세요.

  • GPU가 약 90% 이상 꾸준히 유지됨: 더 빠른 GPU 또는 측정된 단일 호스트 멀티 GPU 실행이 도움이 될 수 있습니다.

  • GPU가 낮거나 불안정함: CPU, DataLoader 워커, 스토리지, 동기화를 먼저 점검하세요.

  • CUDA OOM: 더 큰 VRAM을 결정하기 전에 오래된 프로세스와 배치 크기 1을 확인하세요.

  • RAM 한도 근처에서 프로세스 종료: 더 많은 VRAM이 아니라 더 많은 컨테이너 메모리를 요청하세요.

유사한 성공적인 실행 후에는 계산 시간, 설정/전송 오버헤드, 실제 컨테이너 요금, 측정된 병목 현상을 해당 카탈로그 프로필에 다시 입력하세요. 일반적인 벤치마크 표가 아닌 그 워크로드 기록이 이후 선택을 개선하게 만듭니다.

또한 스토리지를 스케줄링의 일부로 취급합니다. 핫 데이터는 /root/autodl-tmp에 있어야 하고, 내구성 있는 체크포인트와 결과는 Elastic 명령이 종료되기 전에 /root/autodl-fs와 같은 영구 스토리지에 있어야 합니다. 소스 연결 운영 규칙은 AutoDL 필드 가이드를 참조하세요.

개인 Pro 계정

공식 Pro API는 지갑, 인스턴스, 상태, 스냅샷, 프라이빗 이미지를 읽고 인스턴스를 생성, 전원 켜기/끄기, 해제할 수 있습니다. 사전 할당 마켓 카탈로그나 재고 엔드포인트는 공개하지 않습니다. 새 Pro 임대의 경우 오프라인 플래너와 함께 최신 콘솔 견적을 사용하세요:

autodl-pilot api wallet
autodl-pilot api instances
autodl-pilot api images
autodl-pilot plan --project project.toml --offers current-offers.toml --output pro.plan.json
autodl-pilot apply-plan --plan pro.plan.json

현재 Pro 스냅샷 문서는 단위를 명시하지 않고 원시 payg_price 필드를 노출하므로 클라이언트는 이를 원시 상태로 유지합니다. 장기 실행 전에 콘솔에서 할당된 가격을 확인하세요. Pro API 생성은 종량제이며 1~4개의 GPU를 허용하고 시스템 디스크 확장을 노출합니다. API 전원 켜기는 콘솔의 무카드 모드가 아닌 GPU 모드를 지원합니다.

원래 오프라인 예제는 토큰 없이 스케줄러를 테스트하는 데 여전히 유용합니다:

autodl-pilot plan --project examples/project.toml --offers examples/offers.toml --profile balanced

그 가격은 픽스처이며 현재 견적 실행 게이트를 통과할 수 없습니다.

배포 운영

autodl-pilot api deployments
autodl-pilot api containers --payload '{"deployment_uuid":"DEPLOYMENT_UUID","page_index":1,"page_size":10}'
autodl-pilot api events --payload '{"deployment_uuid":"DEPLOYMENT_UUID","page_index":1,"page_size":10,"offset":0}'

autodl-pilot deployment-stop DEPLOYMENT_UUID
autodl-pilot deployment-stop DEPLOYMENT_UUID --confirm

autodl-pilot deployment-delete DEPLOYMENT_UUID
autodl-pilot deployment-delete DEPLOYMENT_UUID --confirm

Elastic 학습은 포그라운드에서 실행되어야 합니다. cmd가 종료되면 컨테이너가 중지됩니다. 백그라운드 python train.py &는 청구 및 수명주기 동작이 연구 작업과 분리된 상태로 남게 할 수 있습니다. 로컬 데이터는 중지 후 영구적이지 않습니다. 재사용 없이는 즉시 해제되고, 재사용 캐시는 잔여물을 보유할 수 있지만 보장된 스토리지도 재시작 가능한 컨테이너도 아닙니다. cmd_before_shutdown은 5초 창만 있으므로 체크포인트 영속성은 학습 명령 자체에 속합니다.

SSH로 시작하는 Pro 장기 실행에서는 screen, tmux 또는 Jupyter 터미널을 사용하고 로그를 명명된 파일에 기록하세요. release 전에 결과를 검색하고 검증하세요. 컴퓨팅 중지와 복구 가능한 상태 삭제는 별개의 결정입니다.

CLI 참조

명령

용도

discover

Enterprise 지갑 및 필터링된 재고, 허용 시 배포/이미지 읽기

live-plan

가격 상한 Elastic 플랜 검색 및 선택

apply-live-plan

Elastic 배포 미리보기 또는 확인

plan

구성된 로컬, 기존, Pro 후보를 오프라인으로 비교

apply-plan

Pro 생성 요청 미리보기 또는 확인

doctor

Python, 토큰 구성, 선택적 API 접근 확인

api ...

지갑, Pro 상태, Elastic 재고/이미지/배포/컨테이너/이벤트 읽기

power-on, power-off, image-save, release

Pro 수명주기 작업 미리보기 또는 확인

deployment-stop, deployment-delete

Elastic 수명주기 작업 미리보기 또는 확인

모든 일반 결과와 통제된 오류는 JSON입니다. 인수는 autodl-pilot --help를 실행하세요.

Codex 및 MCP

mcp 엑스트라를 설치하고 이 저장소를 로컬 Codex 플러그인으로 로드하세요. .mcp.json은 Windows를 대상으로 하며, docs/mcp.unix.json은 Unix 매니페스트입니다. MCP는 CLI와 동일한 검색, 라이브 계획, 미리보기, 확인, 읽기, 수명주기 작업을 노출합니다.

Codex Skill은 skills/autodl-research-pilot/SKILL.md에 있습니다. 유용한 첫 프롬프트는 다음과 같습니다:

AutoDL API를 사용하여 실시간 Elastic 재고를 확인하고, balanced 모드에서 지원되는 GPU 프로필을 비교하고, 정확한 배포 미리보기를 보여주세요. 생성 전에 제 승인을 기다리세요.

범위

0.2.0 버전은 API 우선 Enterprise 단일 GPU Container 경로를 구현하고 Pro/오프라인 계획 기능을 유지합니다. API 클라이언트는 제어 평면이며, SSH 전송, 워크로드 실행, 메트릭 수집, 체크포인트 검색은 Skill이 조정하는 데이터 평면 작업으로 남아 있습니다. 카탈로그 피드백은 자동 원격 측정이 아니라 Skill 안내 방식입니다. 런타임 비용은 fixed_cost로 제공된 경우에만 스토리지를 포함합니다. 구매한 Elastic 기간 패키지 잔액은 아직 모델링되지 않으므로, 이를 적용하면 추정치가 한계 현금 비용을 과대 평가할 수 있습니다.

엔드포인트 및 단위 경계는 AutoDL API Boundaries에 문서화되어 있습니다. 이 프로젝트는 커뮤니티 프로젝트이며 AutoDL과 관련이 없습니다.

개발

python -m unittest discover -s tests -v

CI는 Python 3.11, 3.12, 3.13에서 테스트 스위트를 실행합니다. CONTRIBUTING.md, SECURITY.md이슈 트래커를 참조하세요.

라이선스

Apache-2.0

A
license - permissive license
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • A paid remote MCP for OpenAI Codex agent coordination MCP, built to return verdicts, receipts, usage

  • Operate Linux, macOS and Windows from your LLM. Every action runs through an auditable allowlist.

  • Pay-per-call agent superpowers: media/video gen, product demos, research, GTM, scraping, compute.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/chengxi271-commits/autodl-research-pilot'

If you have feedback or need assistance with the MCP directory API, please join our Discord server