Skip to main content
Glama

AutoDL Research Pilot

AutoDL Research Pilot ofrece a Codex una forma práctica de responder dos preguntas: ¿debería este experimento alquilar una GPU ahora, y qué GPU disponible merece la pena alquilar?

El flujo de trabajo Enterprise Elastic comienza con la API oficial de AutoDL. Lee el saldo de la cuenta y el stock de GPU filtrado por región, CUDA, CPU, RAM y precio; los despliegues y las imágenes privadas se añaden cuando el token puede acceder a ellos. El planificador combina ese estado en vivo con evidencia de rendimiento específica de la carga de trabajo, compara el tiempo total de finalización y el coste total, y construye una solicitud de despliegue Container exacta. La solicitud permanece local hasta que un investigador la aprueba.

Que la tarifa por hora sea alta no significa automáticamente que sea cara. Si una GPU más rápida reduce una ejecución de 30 horas a ocho, puede terminar antes y costar menos en total. Por el contrario, una GPU de gama alta puede pasar la mayor parte del tiempo esperando a un DataLoader. Research Pilot modela la ejecución en lugar de clasificar nombres de productos.

Qué hace

  • Usa la API oficial como plano de control. El descubrimiento Enterprise, la planificación, la creación de despliegues, el listado, la detención y la eliminación son operaciones de primera clase en CLI y MCP.

  • Hace que la disponibilidad sea ejecutable. El stock se consulta con los mismos filtros de región, CUDA, CPU/RAM, modelo de GPU y price_to que se aplican en el despliegue.

  • Optimiza la ejecución completa. El tiempo de ejecución, la configuración, la transferencia, la cola, el rendimiento de la carga de trabajo, la incertidumbre y los costes fijos conocidos alimentan una comparación de Pareto coste/tiempo.

  • Comprende las restricciones de la investigación. La VRAM, el presupuesto, la fecha límite, el inventario y la preparación de la ejecución son filtros estrictos. El modelo, los datos, la precisión, las semillas, la semántica de lote y la evaluación no cambian silenciosamente para adaptarse a una tarjeta más barata.

  • Ofrece preferencias claras. economy minimiza el coste total conservador; time minimiza el tiempo de finalización dentro del presupuesto; balanced elige un punto intermedio; custom acepta tus propios pesos.

  • Mantiene las acciones de pago revisables. Las mutaciones son vistas previas de solicitud por defecto. Una creación Elastic confirmada vuelve a comprobar la capacidad del saldo, los nombres de ejecución duplicados, el acceso a la imagen privada y su presencia, el inventario completo de candidatos y la fecha límite inmediatamente antes de la llamada a la API.

  • Se distribuye como CLI, servidor MCP y Codex Skill. La Skill también cubre el diagnóstico de GPU, el almacenamiento, las imágenes, los comandos en primer plano, los puntos de control y la diferencia de ciclo de vida Pro/Elastic.

Related MCP server: Run:AI MCP Server

Inicio rápido: Enterprise Elastic

Instalar

git clone https://github.com/chengxi271-commits/autodl-research-pilot.git
cd autodl-research-pilot
python -m venv .venv

Windows PowerShell:

.\.venv\Scripts\Activate.ps1
python -m pip install -e ".[mcp]"
$env:AUTODL_TOKEN = "YOUR_TOKEN"

Linux / macOS:

source .venv/bin/activate
python -m pip install -e '.[mcp]'
export AUTODL_TOKEN='YOUR_TOKEN'

Mantén el token en el entorno del proceso. El proyecto nunca lo necesita en TOML, JSON, un argumento de comando o el control de versiones.

Describir esta ejecución

Copia los ejemplos Enterprise y sustituye la imagen, el comando, las regiones, los límites de recursos, los factores de rendimiento de la carga de trabajo y los límites de precio:

cp examples/elastic.project.toml my-run.project.toml
cp examples/elastic.catalog.toml my-run.catalog.toml

El catálogo es deliberadamente pequeño. Enumera los perfiles de GPU que estás dispuesto a usar, no todas las GPU que AutoDL haya ofrecido alguna vez. Establece image_source en private para una imagen de cuenta o en public para un UUID del apéndice de la API de AutoDL. Cuando dc_list abarque varias regiones, prepara el almacenamiento de entrada y salida en cada región indicada o reduce la lista a la que ya está preparada. Cada performance_factor debe proceder de la misma carga de trabajo o de una estimación claramente etiquetada; cada price_ceiling_cny es tu precio máximo aceptable por hora, no una cotización de mercado declarada.

Descubrir, planificar y previsualizar

autodl-pilot discover --catalog my-run.catalog.toml --output live-context.json

autodl-pilot live-plan --project my-run.project.toml --catalog my-run.catalog.toml --profile balanced --output run.plan.json

autodl-pilot apply-live-plan --plan run.plan.json

live-plan realiza un descubrimiento nuevo por defecto, por lo que el comando discover por separado es opcional. Es útil cuando quieres inspeccionar lo que devolvió la API o congelar una instantánea de solo lectura para discutirla.

La vista previa contiene el nombre único de la ejecución, la GPU exacta, las regiones disponibles, la imagen y su fuente, el comando en primer plano, el rango de CPU/RAM y el límite de precio. No realiza ninguna llamada de mutación. Comprueba selected.execution_ready; si es false, selected.needs_input indica el acceso a la cuenta, la imagen o el control de investigación que falta. Después de revisar una solicitud lista para ejecutarse:

autodl-pilot apply-live-plan --plan run.plan.json --confirm

La confirmación vuelve a consultar el saldo, los despliegues activos con el mismo nombre de ejecución, la imagen privada seleccionada y todos los filtros de stock del catálogo. Comprueba que el tiempo de ejecución conservador sigue encajando en la fecha límite congelada y, a continuación, llama a POST /api/v1/dev/deployment. Si el perfil seleccionado desaparece o aparece un candidato antes no disponible, vuelve a la planificación en lugar de crear a partir de una clasificación obsoleta o sustituir la GPU por una no aprobada.

Cómo funciona la decisión

Para el perfil de GPU g, el planificador parte de un tiempo de ejecución de referencia y estima:

compute time = reference runtime / workload performance factor
total time   = queue + setup + transfer + compute time
total cost   = fixed cost + billed time × hourly price ceiling × GPU count

La evidencia de rendimiento con menor confianza amplía el tiempo y el coste conservadores. Los candidatos que incumplen una restricción estricta nunca llegan a la puntuación de perfiles. Los supervivientes forman una frontera de Pareto: ningún candidato de la frontera es a la vez más lento y más caro que otro.

Profile

Selection rule

economy

Menor coste total conservador; el tiempo desempata

balanced

Arrepentimiento coste/tiempo, pesos por defecto 45% / 55%

time

Menor tiempo de finalización conservador dentro del presupuesto

custom

Pesos normalizados de la política del proyecto

La respuesta de la API sobre el stock informa del número de tarjetas libres, no de precios precisos ni de velocidad de referencia. Por lo tanto, Research Pilot mantiene estos hechos separados:

  1. El stock de AutoDL demuestra la disponibilidad actual dentro de una banda de precios.

  2. El catálogo registra la VRAM y la evidencia de rendimiento de la carga de trabajo.

  3. El price_to de Elastic limita lo que el despliegue puede aceptar; el planificador usa ese límite para una factura conservadora.

El planificador en vivo actual crea intencionadamente despliegues Container de una sola GPU. AutoDL documenta el stock como una consulta de una sola tarjeta y advierte de que dos tarjetas libres pueden estar en hosts diferentes. La planificación multi-GPU debe seguir una prueba de escalado con la misma carga de trabajo y una evidencia explícita de mismo host, en lugar de una suma optimista de inventario.

Cómo elegir la GPU de forma más inteligente

La tabla de rendimiento oficial de AutoDL es un punto de partida útil, pero sus ejecuciones usan una sola tarjeta, entrada sintética en memoria y omiten el preprocesado de CPU y la E/S adicional. Es preferible una prueba breve del modelo real, la precisión, la semántica de lote y el canal de datos.

La Skill incluida sigue una regla sencilla de cuellos de botella:

  • GPU al 0%: comprueba el uso del dispositivo y la compatibilidad con el framework/CUDA.

  • GPU estable por encima del 90% aproximadamente: una GPU más rápida o una ejecución multi-GPU medida en un solo host puede ayudar.

  • GPU baja u oscilante: inspecciona primero la CPU, los workers de DataLoader, el almacenamiento y la sincronización.

  • CUDA OOM: comprueba los procesos obsoletos y un tamaño de lote de 1 antes de decidirte por más VRAM.

  • Proceso terminado cerca del límite de RAM: solicita más memoria de contenedor, no más VRAM.

Después de una ejecución exitosa comparable, vuelve a introducir su tiempo de cómputo, la sobrecarga de configuración/transferencia, la tarifa real del contenedor y el cuello de botella medido en el perfil de catálogo correspondiente. Ese historial de carga de trabajo, más que una tabla de referencia genérica, hace que las elecciones posteriores mejoren.

También trata el almacenamiento como parte de la planificación. Los datos calientes deben estar en /root/autodl-tmp; los puntos de control durables y los resultados deben estar en almacenamiento persistente, como /root/autodl-fs, antes de que un comando Elastic termine. Consulta la guía de campo de AutoDL para conocer las reglas operativas enlazadas a las fuentes.

Cuentas personales Pro

La API Pro oficial puede leer el saldo, las instancias, el estado, las instantáneas y las imágenes privadas, y puede crear, encender/apagar y liberar instancias. No publica un catálogo de mercado de preasignación ni un endpoint de stock. Para un nuevo alquiler Pro, usa una cotización actualizada de la consola con el planificador sin conexión:

autodl-pilot api wallet
autodl-pilot api instances
autodl-pilot api images
autodl-pilot plan --project project.toml --offers current-offers.toml --output pro.plan.json
autodl-pilot apply-plan --plan pro.plan.json

La documentación actual de instantáneas Pro expone campos payg_price en bruto sin declarar su unidad, por lo que el cliente los conserva tal cual. Verifica el precio asignado en la consola antes de una ejecución larga. La creación mediante la API Pro es de pago por uso, acepta de una a cuatro GPU y expone la ampliación del disco del sistema; el encendido mediante API admite el modo GPU, no el modo sin tarjeta de la consola.

El ejemplo original sin conexión sigue siendo útil para probar el planificador sin token:

autodl-pilot plan --project examples/project.toml --offers examples/offers.toml --profile balanced

Sus precios son datos fijos y no pueden superar el control de ejecución de la cotización actual.

Operar un despliegue

autodl-pilot api deployments
autodl-pilot api containers --payload '{"deployment_uuid":"DEPLOYMENT_UUID","page_index":1,"page_size":10}'
autodl-pilot api events --payload '{"deployment_uuid":"DEPLOYMENT_UUID","page_index":1,"page_size":10,"offset":0}'

autodl-pilot deployment-stop DEPLOYMENT_UUID
autodl-pilot deployment-stop DEPLOYMENT_UUID --confirm

autodl-pilot deployment-delete DEPLOYMENT_UUID
autodl-pilot deployment-delete DEPLOYMENT_UUID --confirm

El entrenamiento Elastic debe ejecutarse en primer plano: cuando cmd finaliza, el contenedor se detiene. Un python train.py & en segundo plano puede dejar la facturación y el comportamiento del ciclo de vida desconectados del trabajo de investigación. Los datos locales no son persistentes tras la detención: sin reutilización se liberan inmediatamente; una caché de reutilización puede conservar restos, pero no es ni almacenamiento garantizado ni un contenedor reiniciable. cmd_before_shutdown dispone de una ventana de solo cinco segundos, por lo que la persistencia de los puntos de control debe estar en el propio comando de entrenamiento.

Para ejecuciones Pro largas iniciadas por SSH, usa screen, tmux o una terminal de Jupyter y escribe los registros en un archivo con nombre. Recupera y verifica los resultados antes de release; detener el cómputo y eliminar el estado recuperable son decisiones separadas.

Referencia de la CLI

Command

Purpose

discover

Leer el saldo Enterprise y el stock filtrado, además de despliegues/imágenes cuando se permita

live-plan

Descubrir y seleccionar un plan Elastic con límite de precio

apply-live-plan

Previsualizar o confirmar el despliegue Elastic

plan

Comparar candidatos locales, existentes y Pro configurados sin conexión

apply-plan

Previsualizar o confirmar una solicitud de creación Pro

doctor

Comprobar Python, la configuración del token y el acceso opcional a la API

api ...

Leer el saldo, el estado Pro, el stock/imágenes/despliegues/contenedores/eventos Elastic

power-on, power-off, image-save, release

Previsualizar o confirmar acciones del ciclo de vida Pro

deployment-stop, deployment-delete

Previsualizar o confirmar acciones del ciclo de vida Elastic

Todos los resultados normales y los errores controlados son JSON. Ejecuta autodl-pilot --help para ver los argumentos.

Codex y MCP

Instala el extra mcp y carga este repositorio como un plugin local de Codex. .mcp.json está orientado a Windows; docs/mcp.unix.json es el manifiesto para Unix. MCP expone las mismas operaciones de descubrimiento, planificación en vivo, vista previa, confirmación, lectura y ciclo de vida que la CLI.

La Codex Skill se encuentra en skills/autodl-research-pilot/SKILL.md. Un primer prompt útil es:

Usa la API de AutoDL para inspeccionar el stock Elastic en vivo, compara mis perfiles de GPU compatibles en modo equilibrado y muestra la vista previa exacta del despliegue. Espera mi aprobación antes de crearlo.

Alcance

La versión 0.2.0 implementa la ruta Container Enterprise de una sola GPU con API como prioridad y conserva la planificación Pro/offline. El cliente API es el plano de control; la transferencia SSH, la ejecución de cargas de trabajo, la recopilación de métricas y la recuperación de puntos de control siguen siendo tareas del plano de datos coordinadas por la Skill. La retroalimentación del catálogo está guiada por Skill en lugar de telemetría automática. El coste en tiempo de ejecución incluye almacenamiento solo cuando se proporciona como fixed_cost. Los saldos de paquetes de duración Elastic adquiridos aún no se modelan, por lo que la estimación puede sobreestimar el coste de caja marginal cuando se aplican.

Desarrollo

python -m unittest discover -s tests -v

CI ejecuta la suite de pruebas en Python 3.11, 3.12 y 3.13. Consulta CONTRIBUTING.md, SECURITY.md y el rastreador de incidencias.

Licencia

Apache-2.0

A
license - permissive license
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • A paid remote MCP for OpenAI Codex agent coordination MCP, built to return verdicts, receipts, usage

  • Operate Linux, macOS and Windows from your LLM. Every action runs through an auditable allowlist.

  • Pay-per-call agent superpowers: media/video gen, product demos, research, GTM, scraping, compute.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/chengxi271-commits/autodl-research-pilot'

If you have feedback or need assistance with the MCP directory API, please join our Discord server