{
  "issue": "2026-08-13",
  "generated_at": "2026-08-13T07:00:00+09:00",
  "theme": {
    "title": "モデルルーティング — 1モデルに全部背負わせない設計が標準になった",
    "category": "model-routing",
    "lede": "2026年に入り、単一のフロンティアモデルに全リクエストを投げるのではなく、タスクの難易度や種類に応じて複数モデルへ振り分ける「モデルルーティング」が、コスト最適化のテクニックから製品アーキテクチャの標準要素へと格上げされた。Vercel・GitHub・OpenRouter・Rampが相次いでルーティング層を公開する一方、Perplexityは逆に複数モデルを並列実行して合議する構成を打ち出した。どちらを選ぶかは、判定を誤ったときのコストをどちらの方向に振るかという設計判断に帰着する。",
    "tldr": [
      "Vercel AI GatewayやGitHub Copilot Autoは、ヒューリスティック分類→難易度ティア判定→プロバイダ違いのフォールバック、という二段構成のタスク別ルーティングをすでに標準実装にしている。",
      "OpenRouterとRampは分類器だけに頼らず、直近の実運用データ（コミュニティの支出実績や本番での品質合格率）を重ねてランキングを継続更新する方式を選んだ。",
      "Perplexity Model Councilはルーティングとは逆の方向で、1クエリを複数モデルに並列投入して合議する構成を高コストな上位プラン限定機能として提供している。"
    ],
    "sections": [
      {
        "heading": "タスク別ルーティングの標準実装 — ヒューリスティックとティア分け",
        "body_html": "<p>ゼロレイテンシーのヒューリスティック分類（入力の長さ、コード片の有無、「なぜ」「手順を追って」のような意図キーワード）でまず難易度ティアを決め、判定が曖昧な場合だけ軽量モデルによる追加分類を呼ぶ。ティアごとに主系モデルと別プロバイダのフォールバックを用意し、品質ゲートを通らなかった場合のみ上位ティアへエスカレーションする——これがVercel AI Gatewayの実装だ。GitHub CopilotのAutoも同様に、推論の深さ・コード生成の複雑さ・バグ診断の難度・ツール呼び出しの必要性といった軸でタスクを評価し、モデルの可用性やレイテンシーも加味して選択する。</p><p>単一モデルで全部処理すると、簡単なタスクにフロンティアモデルの料金を払うか、難しいタスクを安いモデルに投げて失敗するかの二択になる。ティア分けすればコストとレイテンシーを両立できる。加えて、判定のたびにモデルを呼んでいては分類コスト自体が無視できなくなるため、「追加の呼び出しをしない分類器が一番安い分類器」という原則が両社の実装に共通している。</p>",
        "examples": [
          {
            "product": "Vercel AI Gateway（コスト最適化ルーティング）",
            "approach": "入力長・コード片有無・意図キーワードのヒューリスティックで難易度ティアを判定し、曖昧な場合のみ軽量モデルで再分類",
            "detail": "ティアごとに主系と別プロバイダのフォールバックを持たせ、品質ゲート不通過時のみ上位ティアへエスカレーションする設計を公式ナレッジベースが解説している",
            "source_url": "https://vercel.com/kb/guide/cost-aware-model-routing-with-ai-gateway"
          },
          {
            "product": "GitHub Copilot Auto（VS Code / CLI）",
            "approach": "推論の深さ・コード生成の複雑さ・バグ診断難度・ツール呼び出し要否を評価してモデルを自動選択",
            "detail": "タスク軸の評価に加えてモデルの可用性・信頼性のリアルタイムシグナルも加味し、キャッシュ境界に沿ってルーティングすると公式changelogが明記",
            "source_url": "https://github.blog/changelog/2026-05-20-auto-model-selection-now-routes-based-on-your-task-in-vs-code/"
          }
        ],
        "takeaway": "自前でルータを作るなら、まずヒューリスティックで粗く分け、迷うケースだけ軽量モデルに判定させる。ティアは「モデル名」ではなく「難易度」で設計し、失敗シグナル（スキーマ不一致・低信頼度）が出たときだけ上位ティアへ逃がす。"
      },
      {
        "heading": "分類器だけでなく本番データを重ねる — OpenRouterとRampの賭け",
        "body_html": "<p>OpenRouterの新しいAuto Routerは、軽量分類器でプロンプトを約30のタスクカテゴリーに割り振ったうえで、カテゴリーごとに「直近7日間にコミュニティが実際に支出したモデル」を参照してランキングを作り、Pareto最適な振り分け曲線を継続更新する。Ramp Routerも社内で3年運用してきたルータを一般公開したもので、品質基準をクリアする中で最も安いモデルへ送り、新しいモデルを毎週実データでテストして結果を自動的にルーティングへ反映する。</p><p>週単位で新モデルが出て価格も性能も動く以上、静的なベンチマークやオフライン評価だけで組んだ分類器はすぐ陳腐化する。実際の支出実績や合格率という「本番のフィードバックループ」を分類結果に重ねることで、ベンチマークを狙い撃ちしたモデルに振り回されにくくなる、というのが両社に共通する設計思想だ。</p>",
        "examples": [
          {
            "product": "OpenRouter Auto Router",
            "approach": "約30カテゴリーへのタスク分類 × 直近7日間のコミュニティ支出データでPareto最適な振り分け曲線を構築",
            "detail": "週55兆トークン規模の実支出データに基づくランキングが旧Auto Routerを上回ると公式ブログが報告している",
            "source_url": "https://openrouter.ai/blog/announcements/introducing-the-new-auto-router/"
          },
          {
            "product": "Ramp Router",
            "approach": "品質基準をクリアする最安モデルへ送り、新モデルを毎週実データで検証してルーティングに反映",
            "detail": "社内で3年運用し100以上のAI機能を支えてきたルータを一般公開した事例として公式サイトが公開",
            "source_url": "https://ramp.com/router"
          }
        ],
        "takeaway": "オフラインベンチマークだけでルータを固定しない。本番の成功率・コスト・支出実績のような運用シグナルを定期的に取り込み、モデルの入れ替わりに追従できる仕組みを最初から組み込む。"
      },
      {
        "heading": "ルーティングをやめて並列合議に倒す設計もある",
        "body_html": "<p>PerplexityのModel Councilは逆方向の賭けだ。1つのクエリをGPT-5.2・Claude Opus 4.6・Gemini 3.0の3モデルに同時に投げ、Claude Opus 4.5を「議長」役の統合モデルとして使い、一致点と相違点を示した単一の回答にまとめる。モデルを1つ選ぶのではなく複数走らせて合意形成する構成で、収束は確信度のシグナル、発散は質問の曖昧さやデータの不確実性を示す警告として扱われる。</p><p>この構成がMax / Enterprise Max向けの上位プランに限定されているのは示唆的だ。1クエリで3モデルと統合モデルを呼ぶため、通常のルーティングに比べてトークンコストが数倍に膨らむ。日常的な質問の大半は適切に1モデルへルーティングすれば十分で、Councilはハイステークスかつ曖昧なクエリという狭いユースケースに絞ることで初めて採算が合う設計だ。</p>",
        "examples": [
          {
            "product": "Perplexity Model Council",
            "approach": "1クエリを3フロンティアモデルへ並列投入し、議長役モデルが統合",
            "detail": "収束・発散を確信度シグナルとして提示する設計を公式ブログが説明。Max / Enterprise Max限定の高コスト機能として提供されている",
            "source_url": "https://www.perplexity.ai/hub/blog/introducing-model-council"
          }
        ],
        "takeaway": "並列合議は「ルーティングの代わり」ではなく「ルーティングで捌ききれない高リスク・曖昧クエリ向けの追加レイヤー」として位置づける。全クエリに適用するとコストが見合わないため、ユーザー選択かpre-classifierで対象を絞り込む設計にする。"
      }
    ]
  },
  "editorial": "ルーティングも合議も、根っこにあるのは「1つのモデルに全部背負わせない」という判断だ。分岐点は難易度分類の精度そのものではなく、判定を誤ったときのコストをどちらの方向に振るか——安く外すか、高く当てるか——という設計判断に集約されつつある。",
  "quick_picks": [
    {
      "title": "Perplexity Computerが19モデルをサブタスク単位で振り分ける仕組み",
      "summary": "画像生成はNano Banana、動画はVeo 3.1というように、タスク種別ごとに固定の専門モデルへ振り分ける静的マッピング型のルーティングを採用している。本文で扱った動的な難易度ルーティングとは対照的で、カテゴリが有限かつ既知な場合に向く設計だ。",
      "url": "https://www.perplexity.ai/hub/blog/introducing-perplexity-computer"
    },
    {
      "title": "GitHub Copilot Auto model selectionの技術詳細",
      "summary": "推論・コード生成複雑度・バグ診断難度・ツールオーケストレーションという4軸でタスクを評価する仕組みを公式ドキュメントが解説している。本文セクション1で扱った二段ルーティングの実装詳細にあたる。",
      "url": "https://docs.github.com/copilot/concepts/auto-model-selection"
    },
    {
      "title": "Perplexity Model Councilの利用者向け解説",
      "summary": "収束と発散をどう読むかなど、Model Councilの使い方をヘルプセンター記事がユーザー目線でまとめている。本文セクション3で触れた並列合議パターンが実際にどう見えるかが分かる。",
      "url": "https://www.perplexity.ai/help-center/en/articles/13641704-what-is-model-council"
    },
    {
      "title": "Copilot CLIにもタスクベースのAuto選択が拡張",
      "summary": "VS Codeで先行していたタスクベースのAuto model selectionが、同じロジックでCLI環境にも展開されたことを公式changelogが告知。本文セクション1のルーティング方式が単一製品内の複数サーフェスへ広がっている例だ。",
      "url": "https://github.blog/changelog/2026-07-01-copilot-cli-auto-model-selection-routes-based-on-task/"
    }
  ]
}
