Skip to main content
Glama

Chimeraforge

PyPI version Python CI License: MIT

ローカルファーストでモデル非依存のLLMデプロイメントプランナー。 「どのモデル、量子化、GPU、バックエンドか——何台必要か、収まるか、SLOを満たせるか、コストはいくらか」という問いを、シェル、Python、またはAIアシスタントから、高速で正直で測定された答えに変えます。

uvx chimeraforge plan --model-size 8b --hardware "RTX 4090 24GB"

信頼の原則

すべての数値は measuredestimatedunknown のいずれかのラベルが付けられ、ツールは裏付けの取れない数値を偽装することを拒否します。 VRAMとKVキャッシュはモデルの実際のアーキテクチャから計算されます(正確)。スループットは利用可能な場合は測定値、それ以外の場合は明示的な帯域幅ローフライン推定値であり、実際のデータとして提示されることはありません。バンドルされたコーパス未満の品質は、捏造されたスコアではなく unknown と報告されます。0件のプランは、汎用的な「何も見つかりません」ではなく、すべての候補を拒否した正確なゲートを指名します。テレメトリなし、ホームコールなし、エアギャップ環境でも動作します。

モデルを指定します——サイズクラス、Hugging Faceリポジトリ、Ollamaタグ、または未公開モデル用の手動オーバーライド——すると、(モデル x 量子化 x バックエンド x GPU数 x テンソル/パイプライン並列) 空間をVRAM、品質、レイテンシ、コスト、エネルギー、オプトインのセーフティゲートに対して検索し、SLOを満たす最も安価な構成を返します。

1つのツールに12のコマンド: plan - suggest - measure - validate - catalog - safety - bench - eval - compare - refit - report - mcp

経験的コーパスはテクニカルレポートTR108-TR137(コンシューマーGPUでの約204,000件の実測定)に由来します。完全な機能履歴についてはCHANGELOGを参照してください。


Related MCP server: infra-advisor-mcp

インストール

インストールなしで試す:

uvx chimeraforge plan --model-size 8b --hardware "RTX 4090 24GB"
pipx run chimeraforge plan --model-size 8b --hardware "RTX 4090 24GB"

実際にインストール:

pip install chimeraforge            # planner + model resolution (HF/Ollama) + suggest/measure/safety/bench
pip install chimeraforge[bench]     # + GPU environment metadata for benchmarks (pynvml)
pip install chimeraforge[mcp]       # + MCP server so Claude/GPT/Cursor can call the planner
pip install chimeraforge[eval]      # + quality evaluation (BERTScore, ROUGE-L)
pip install chimeraforge[refit]     # + coefficient refitting (numpy, scipy)
pip install chimeraforge[all]       # everything

Python 3.10以上。コアインストールはプランナーとネットワーク関連コマンドをカバーします(httpx はコア依存)。plan / suggest / catalog は完全にオフラインで動作します。bench / measure / safety は実行中のバックエンド(Ollama、vLLM、またはTGI)が必要です。Windows / macOS / Linux。

クイックスタート

# Plan a registry size class on your GPU
chimeraforge plan --model-size 8b --hardware "RTX 4090 24GB" --request-rate 2.0

# Plan ANY model -- a Hugging Face repo or an Ollama tag
chimeraforge plan --model Qwen/Qwen2.5-7B-Instruct --hardware "RTX 4090 24GB"
chimeraforge plan --model ollama:qwen3:14b --ollama-url http://localhost:11434

# Split a model too big for one GPU across several (tensor parallelism)
chimeraforge plan --model meta-llama/Llama-3.3-70B-Instruct --hardware "H100 80GB" --tp 4

# Shrink the KV-cache, print the cost/latency/quality trade-off menu
chimeraforge plan --model-size 8b --hardware "RTX 4080 12GB" --kv-quant q8 --pareto

# Benchmark a live model and plan on the MEASURED numbers
chimeraforge plan --model qwen3:14b --measure

# Discover + rank what fits your GPU and budget
chimeraforge suggest --source ollama --hardware "RTX 4090 24GB" --budget 500

MCPサーバー——Claude / GPT / Cursor に同じ数値を提供

GPUサイジングはまさにアシスタントが失敗する場所です:トレーニングカットオフのハードウェア価格と仕様、さらにメモリからの誤りやすいKVキャッシュ/バッチ演算。chimeraforge mcp はstdio MCPサーバーを実行し、アシスタントが推測する代わりに測定データに対して実際のプランナーを呼び出します。

pip install "chimeraforge[mcp]"

Claude Code:

claude mcp add --transport stdio chimeraforge -- uvx --from "chimeraforge[mcp]" chimeraforge mcp

Claude Desktop / Cursor(MCP設定ファイルに追加):

{
  "mcpServers": {
    "chimeraforge": {
      "command": "uvx",
      "args": ["--from", "chimeraforge[mcp]", "chimeraforge", "mcp"]
    }
  }
}

--from "chimeraforge[mcp]" はMCP SDKを取得します。uvx は自己完結環境でサーバーを実行します。クライアントが起動する環境にすでに pip install "chimeraforge[mcp]" している場合は、代わりに "command": "chimeraforge", "args": ["mcp"] を使用できます。

3つのツールを公開します:chimeraforge_plan(完全なゲート検索)、chimeraforge_resolve_model(モデルIDを実際のパラメータ/アーキテクチャに基づかせる)、chimeraforge_list_hardware。すべての結果はCLIと同じ measured / estimated / unknown の出所を持ち、ツールの説明はモデルに自身の知識よりもこれらを優先するよう指示します。chimeraforge_plan は推奨構成のサーブコマンドである launch フィールドも返すため、アシスタントは「どう実行するか」という質問にフラグを捏造せずに答えることができます。


コマンド

plan — 予測キャパシティプランナー

chimeraforge plan --model-size 8b --hardware "RTX 4090 24GB" --request-rate 2.0
chimeraforge plan --model Qwen/Qwen2.5-7B-Instruct --hardware "RTX 4090 24GB"   # any HF repo
chimeraforge plan --model ollama:qwen3:14b --ollama-url http://localhost:11434  # any Ollama tag
chimeraforge plan --model meta-llama/Llama-3.3-70B-Instruct --hardware "H100 80GB" --tp 4   # multi-GPU
chimeraforge plan --model-size 3b --kv-quant q4 --pareto                       # smaller KV cache, trade-off menu
chimeraforge plan --model-size 8b --hardware "RTX 4090 24GB" --launch          # + the serve command to actually run it
chimeraforge plan --model-size 3b --workload agent --safety-target 0.85 --json
  • あらゆるモデルを計画:レジストリサイズクラス、HFリポジトリ(org/name)、Ollamaタグ、または手動オーバーライド(--params-b/--n-layers/...)。

  • (モデル x 量子化 x バックエンド x Nレプリカ x バッチ/GPU) を5ゲートパイプラインで検索:VRAM -> 品質 -> セーフティ(オプトイン) -> レイテンシ -> 予算。

  • 実際のサーブ物理をモデル化:連続バッチング(vLLM/TGI)、プリフィル/デコード分割(TTFT + TPOT)、KVキャッシュ制約の並行性、分散を考慮したキューイング(--workload)。

  • 1つのGPUに収まらない大きなモデルにも対応: --tensor-parallel/--tp {N|auto} は重みとKVをN個のGPUにシャード化(Megatronスタイル、通信モデル化)。--pipeline-parallel/--pp {N|auto} は代わりにレイヤーをNステージに分割(遅いインターコネクトで安価、パイプラインを満たすにはバッチングが必要)。まだ組み合わせ不可。

  • バックエンドが提供するものをサーブ: GGUF量子化はOllamaで提供。vLLM/TGIはFP16とFP8(FP8テンソルコアを持つGPUのみ——Ada/Hopper/Blackwell/CDNA3)。プランナーはもはやllama.cppのスピードアップで価格設定されたvLLMにGGUFチェックポイントを提案しません。

  • KVキャッシュ量子化--kv-quant {fp16,q8,q4})はキャッシュを縮小し最大並行性を向上——長いコンテキストで最大の効果。

  • コストの現実性--duty-cycle--gpu-price-multiplier):見出しの$/1Mトークは飽和したフリートの価格です。プロビジョニングされたヘッドルームとアイドル時間のコストも支払うため、2 req/sの8Bモデルの実効数値は、フルデューティで**$2.71/1M、30%で$9.04/1M**、キャパシティ時は$0.92です。スポット/リザーブド価格はあなたの入力であり、バンドルされた推測ではありません。

  • セルフホスト vs API損益分岐点--compare-api):ワークロードをホスト型APIと価格比較し、セルフホストが勝ち始める月間ボリュームを報告。価格はプロバイダーごとのソースURL付きの日付入りスナップショットで、90日を超えると古いとフラグ付けされます——決してライブ見積もりとして提示されません——またフロンティアAPIは同等ではなく異なる品質層としてラベル付けされます。

  • プレフィックスキャッシュ--prefix-cache-hit-rate):チャットボットとエージェントのトラフィックは長いシステムプロンプトを再利用するため、プリフィルの大部分はすでにキャッシュされています。4kプロンプトで90%のヒット率の場合、8BはTTFTが166msから17msになります。デフォルトは0で、決して推測されません。共有プレフィックスが節約するKVは意図的に差し引かれません——KVを過小評価することが「収まる」をOOMに変えるからです。

  • 推論モデル--reasoning-tokens N):隠れた思考トークンはGPUによってデコードされ、呼び出し元には見えなくてもKVに保持されます。可視出力のみを数えると、推論比だけデコードを過小評価します——1000の隠れトークンは、私たち自身のチェックで8Bプランのp95を363msから6128msにしました。デフォルトは0で、決して推測されません:比率はワークロードの特性であり、重みの特性ではありません。

  • アテンション形状を考慮したKV: MLA(DeepSeek-V2/V3)はヘッドごとのK/Vではなく圧縮された潜在変数をキャッシュします——GQAとしてサイズ設定するとDeepSeek-V3のキャッシュを57倍過大評価します——またスライディングウィンドウモデルはウィンドウを超えてキャッシュを成長させません。レイヤーパターンが宣言されていないウィンドウは適用されません。なぜならKVの過小評価が「収まる」をOOMに変えるからです。

  • Mixture-of-Experts対応: VRAMはパラメータでサイズ設定(すべてのエキスパートが常駐)され、スループットとTTFTはアクティブパラメータを使用(トークンはルーティング先のエキスパートのみを読み取る)。MoEモデルを高密度として扱うと、Mixtral-8x7Bでスループットを3.6倍、DeepSeek-V3で約18倍過小予測します。アクティブ数はモデルの実際のエキスパート形状から導出され、公開された数値と一致します。

  • エネルギー--electricity-rate):月間kWhコスト、$/1Mトーク(+エネルギー)、およびトーク/秒/ワットを、予算ゲートに(組み込むのではなく)並べて報告。

  • 起動コマンドのエクスポート--launch):勝者構成の vllm serve / ollama run / TGI docker run コマンドを、プラン自身のコンテキスト長、TP/PP次数、バッチサイズ、KV dtypeを埋め込んで出力——手計算でエラーを起こしやすいフラグ。導出できないものを捏造しません:GGUF量子化レベルは、発明された --quantization フラグではなく、ネイティブ相当のチェックポイントをサーブするためのメモになります。

  • 予測ごとの出所(measured / estimated / unknown);何も収まらない場合の制約ゲートを説明。

  • レジストリデータで検証済み:VRAM R^2=0.968、スループット R^2=0.859、品質 RMSE=0.062、レイテンシ MAPE=1.05%(解析的M/D/1を20.4倍上回る、TR133)。MLなし——経験的ルックアップテーブルと第一原理補間(レジストリ外モデルはローフライン)。

suggest — モデルの発見とランキング

chimeraforge suggest --source ollama --hardware "RTX 4090 24GB" --budget 500
chimeraforge suggest --source hf --hf-limit 8 --hardware "RTX 4080 12GB"
chimeraforge suggest --source catalog --hardware "RTX 4080 12GB"   # offline, after `catalog --build`

ライブOllama(/api/tags)、HF Hub(トップテキスト生成)、および/またはローカルカタログから候補を取得し、それぞれを実際のパラメータ/アーキテクチャに解決し、同じゲート検索を実行し、モデルごとに最適な構成を表示します。

measure — ライブでベンチマークし、実数で計画

chimeraforge measure --model qwen3:14b --ollama-url http://localhost:11434
chimeraforge plan --model qwen3:14b --measure   # measure then plan in one step

ライブモデルをベンチマークし(実際のN=1スループット、サービス時間、並行性スケーリング)、ローカルコーパスに組み込みます。plan / suggest は自動的に測定値を優先します(出所は measured に変わります)。

catalog — ローカルモデルカタログ

chimeraforge catalog --build         # resolve a curated seed (+ --with-ollama) and cache specs
chimeraforge catalog                 # list the cached catalog

解決された仕様を永続化し、suggest --source catalog が既知の良好なセットを完全にオフラインでランキングできるようにします。

safety — ライブ拒否スクリーニング

chimeraforge safety --model llama3.2-3b --prompts harmful.txt --quant Q4_K_M --safety-target 0.85

plan --safety-target がバンドルされたTR134/TR142データから決定するのに対し、safety測定します:ライブモデルに対してプローブプロンプトを実行し、拒否を分類し(ルールベース——TR134正規表現ベースライン)、測定された拒否率をバンドルされたゲートデータ(期待値、ドリフト、RTSIリスク層)と比較し、--safety-target を下回ると終了コード1で終了します。プロンプトはあなたが提供します--prompts、1行に1つ)——攻撃コーパスはパッケージに同梱されていません。HarmBench / AdvBench / 独自のセットを指定してください。実行中のOllamaが必要です。

bench — ライブ推論ベンチマーク

chimeraforge bench --model llama3.2-3b --runs 5
chimeraforge bench --model llama3.2-3b --all-quants --context 512,1024,2048,4096 --json
chimeraforge bench --model llama3.2-3b --backend vllm --base-url http://localhost:8000

3つのワークロードプロファイル(単一 / バッチ / サーバーPoisson);スループット、TTFT、レイテンシをp50/p90/p95/p99で測定;CVベースの安定性警告;JSON出力。

eval — 品質評価

chimeraforge eval --task general_knowledge --json
chimeraforge eval --predictions preds.txt --references refs.txt --model llama3.2-3b

メトリクス:完全一致、ROUGE-L(LCSフォールバック)、BERTScore、コヒーレンス -> 複合(0.2*EM + 0.3*ROUGE + 0.3*BERT + 0.2*コヒーレンス)。品質層はTR125から;3つの組み込みタスク(general_knowledge、summarization、code)。--fp16-baseline を渡すと低下層を分類します。

compare — ベンチマーク実行の差分

chimeraforge compare --baseline run1.json --candidate run2.json,run3.json --json

構成を(モデル、バックエンド、量子化、ワークロード、コンテキスト長)でマッチングし、スループット/TTFT/期間のデルタを集計的な改善/回帰サマリーとともに計算します。

refit — プランナー係数の更新

chimeraforge refit --bench-dir ./results/ --output fitted_models.json --validate

ベイズブレンディング(キーごとの信頼重み付け)、ハードウェアオフセット、べき乗則再フィッティング、および書き込みをゲートする10チェックの検証スイート(--validate)。

report — レポート生成

chimeraforge report --results-dir ./results/ --format markdown --output report.md

Markdown(GitHub互換)と自己完結型のXSS安全なHTML;統計分析(RMSE、MAE、MAPE、R^2)と構成ごとのパーセンタイルテーブル。

mcp — プランナーをAIアシスタントに提供

chimeraforge mcp

上記のstdio MCPサーバーを実行します。pip install "chimeraforge[mcp]" が必要です。


モデル化されているもの

次元

計算方法

由来

VRAM / KVキャッシュ

実際のモデルアーキテクチャからの第一原理計算。KV量子化とTP/PP対応シャーディング

正確

最大同時実行数

GPUあたりのKVキャッシュ制約シーケンス数

正確

スループット(デコード)

測定ルックアップ、それ以外は帯域幅ルーフライン。継続的バッチング曲線。TP通信 / PPバブル

測定 / 推定

TTFT(プリフィル)

計算バウンド、GPU FP16 TFLOPS x MFU

推定

品質

測定された複合ルックアップ、ファミリー事前推定、または不明

測定 / 推定 / 不明

コスト

GPU $/時 x フリート規模(レプリカ数で不変の$/100万トークン)

正確

エネルギー

TDPベースの月間kWh、$/100万トークン(+エネルギー)、トークン/秒/ワット

推定

安全性

TR134/TR142拒否率ルックアップ(オプトインゲート)

測定 / 不明

ハードウェア: 22 GPU -- コンシューマー向けAda + Blackwell(RTX 30/40/50シリーズ)、データセンター向け(A100 40/80GB、H100、H200、B200、L4、T4)、およびAMD MI300X -- それぞれVRAM、帯域幅、FP16 TFLOPS、TDP、インターコネクト(NVLink/Infinity Fabric/PCIe)を備える。

既知の制限(正直なところ): 投機的デコードはまだモデル化されていません。プレフィックスキャッシュはプリフィルの節約をモデル化しますが、KVの節約はモデル化しません(意図的に保守的)。推論トークンはモデル化されますが、比率はあなたの入力(--reasoning-tokens)であり、推測されることはありません。MoEの場合、アクティブ対総パラメータモデル化されますが、エキスパート並列とルーティング負荷不均衡はモデル化されません。vLLM/TGIの量子化カバレッジはFP16 + FP8(AWQ/GPTQは未対応)。FP8品質は推定であり、測定ではありません。TPおよびPPスループットは通信モデル化された推定値であり、測定値ではなく、1つのプランで組み合わせることはできません。待ち行列は解析的(分散認識)であり、離散事象シミュレータではありません。同梱のコーパスは主に1台のリグ(RTX 4080 12GB)に適合しています。他のGPUは、あなたの環境でmeasureするまでは帯域幅/計算からスケーリングされます。MCPサーバーはstdioのみ(Claude Code/Desktop、ローカルCursor)-- ホスト型リモートトランスポートはまだありません。


研究が決定したこと

フェーズ2(TR123-TR133、約106,000件の測定)は、アーティファクトに基づくデプロイフレームワークに蒸留されました -- プランナーが適用するのと同じルールです:

決定

推奨

根拠

シングルエージェントバックエンド

Ollama Q4_K_M

最高のスループット/ドル。品質は-4.1pp以内(TR123-TR125)

マルチエージェントバックエンド(N>=4)

vLLM FP16

継続的バッチングによる2.25倍の優位性(TR130-TR132)

コンパイルポリシー

プリフィルのみ、Linux、Inductor+Triton

24-60%の高速化。デコードは100%クラッシュ(TR126)

量子化

Q4_K_Mデフォルト。Q8_0は品質重視。Q2_Kは不可

5モデルにわたる普遍的なスイートスポット(TR125)

コンテキスト予算

12GBで4Kトークン超はOllama

VRAMオーバーフロー = 25-105倍の崖(TR127)

キャパシティ計画

chimeraforge plan

R^2>=0.859で検証。M/D/1を20.4倍上回る(TR133)

安全性スクリーニング

plan --safety-target(オプトイン)

構成ごとの拒否率 + RTSIリスク。安全性を崩壊させるセルを拒否(TR134/TR142)

主要な発見(完全なデータはTRにあります):RustはPythonシングルエージェントを上回る(+15.2%スループット、-58% TTFT、-67%メモリ -- TR112)。デュアルOllamaはほぼ完璧なマルチエージェント並列性(約99%)を達成し、単一インスタンスの82.2%を上回る(TR110/TR113/TR114)。vLLMの継続的バッチングはN=8で2.25倍の優位性をもたらし、ボトルネックはスタックではなくGPUメモリ帯域幅にある(TR130-TR132)。

完全な研究: docs/archive/technical_reports.md は全32レポートの索引です。方法論と生データ参照を含む完全なアーカイブは outputs/publish_ready/reports/ にあります。


数値の作り方

  • 約204,000件の一次測定 は、RTX 4080 Laptop(12GB)上の32件のテクニカルレポート(TR108-TR137 + TR142/TR146安全性由来)にわたります。重複排除済み:TR137/TR142はすでにカウントされたデータの統合です。

  • 厳密性: 実行ごとの新規プロセス分離(ウォームキャッシュバイアスなし)、強制コールドスタート、統計的信頼性のための構成ごとに3-5回の実行、完全な由来を備えた構造化JSON/CSVロギング。すべての主張は再実行可能な生データに遡れます。

  • プログラムの文脈: ChimeraForgeは、親プログラムであるBanterhearts(54件のTRにわたる約1,337,000件の一次 + ジャッジ測定)から切り出した実践可能なCLIです。安全性の攻撃面とサービングスタックの研究は、関連リポジトリにあります。

  • 549件の自動テストpytest tests/)は、プランナーモデル、ゲート探索、リゾルバ、ディスカバリ、安全性、ベンチバックエンド、MCPサーバーをカバーしています -- GPU非依存で、コアスイートにライブバックエンドは不要です。

任意の数値を再現するには:outputs/publish_ready/reports/ のレポートで主張を見つけ、その参照をデータフォルダに辿り、CSV/JSONを検査し、提供されたスクリプトまたはノートブックを再実行してください。docs/archive/methodology.md を参照。

リポジトリ構成

パス

内容

src/chimeraforge/

chimeraforge CLI + キャパシティプランナー(pipパッケージ)

src/python/banterhearts/

Pythonエージェントのベンチマーク、モニタリング、プロファイリング

src/rust/

Rustシングルおよびマルチエージェント実装(Tokio + 4つの代替ランタイム)

outputs/publish_ready/reports/

正規のTRアーカイブ(TR108-TR137)+ 統合 -- 発見はここから

docs/

ガイド、APIリファレンス、テクニカルレポート索引 -- ハウツーはここから

experiments/data/benchmarks/

再現用スキャフォールド、ベースライン、生のベンチマークアーティファクト

ドキュメント

コントリビューション

コントリビューション歓迎 -- CONTRIBUTING.md を参照。適した分野:追加のベンチマーク構成、新しい最適化戦略、より多くのモデル/ハードウェア、ドキュメント、分析ツール。

ライセンス

MIT -- LICENSE を参照。

謝辞

Banterhearts LLMパフォーマンス研究プログラムの一環として実施:フェーズ1(TR108-TR122)は測定方法論と言語間比較を確立し、フェーズ2(TR123-TR133)はデプロイフレームワークとキャパシティプランナーを生み出し、フェーズ3(TR134-TR137)は推論最適化の安全性コストを測定しました -- 現在はプランナーのオプトイン安全性ゲートとなっています。


リポジトリ: https://github.com/Sahil170595/Chimeraforge - PyPI: https://pypi.org/project/chimeraforge/ - ステータス: ベータ版、活発に開発中

Install Server
A
license - permissive license
A
quality
A
maintenance

Maintenance

Maintainers
24dResponse time
4dRelease cycle
37Releases (12mo)
Commit activity

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • Will this LLM fit on your GPU, multi-GPU rig or Mac? Exact VRAM & KV-cache math. Read-only.

  • Measured AI-inference-storage benchmarks with citations, article search, KV-cache ROI estimation.

  • Provision private AI model endpoints on dedicated GPUs (Llama, Qwen, Mistral). Pay per minute.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/Sahil170595/Chimeraforge'

If you have feedback or need assistance with the MCP directory API, please join our Discord server