Claude Code 流の agentic 編成をゲームに使うためのプロトコルとベンチマークを作っています —— シミュレーション、ロールプレイング、ナラティブ、world-model 駆動の体験を対象に。

ポイントは AI TRPG のデモを 1 本出すことではなく、その下にあるランタイム層です:世界・キャラ・記憶・ルール・物語を、役割の分かれた agent が一緒に動かす。そしてその連携自体を、過去 20 年のゲームエンジンと同じく、検査でき、差し替えられ、ベンチマークできる。

仕事は 3 つ。

agent と sub-agent のプロトコル

発想元は Claude Code の router → sub-agent スタイル。それをゲーム世界向けに調整します。プロトコルが定義するもの:

  • agent 間の通信方法 —— メッセージ形状、ツールサーフェス、状態の引き渡し

  • 責任分担 —— 誰が何を読むか、誰が何を書くか

  • 世界状態の更新方法 —— ファイル、それとも構造化イベントログ

  • キャラクターの一貫性の保ち方 —— キャラごとの記憶レイアウト

  • 自由度とナラティブの一貫性のバランス

今これらは WorldLines リポジトリ内の「慣習」として存在しています。これを、他のチームが読み、実装し、異論を出せる「プロトコル」へ引き上げる、というのがここの仕事。

より多くの agent システムと、低コスト LLM への対応

「Claude 専用クラブ」にはしたくない。豊かなロールプレイの 1 ターンは agent 呼び出しを何十回も組み合わせます。そのすべてに最先端の有料モデルを要求したら、一握りのスタジオ以外、経済性が合いません。

具体的には:

  • 薄いランタイムアダプタ(Claude Code、OpenAI 互換 API、ローカル Qwen / Llama 系、将来の agent SDK)

  • agent ごとのモデル選択 —— ナレーションは強いモデル、ルール判定は安いモデル

  • 単一の価格帯ではなく、押し広げていける「品質/コスト」のフロンティア

同じアーキテクチャ、違うバックエンド、セッション単価を時間とともに下げていく。

agent × LLM の組み合わせのためのベンチマーク

公開されている LLM ベンチマークは、ロールプレイが本当に気にする能力を間接的にしか測れません —— 想起、数学、コード、指示追従。NPC を 40 セッション越しに一貫させられるか、ある agent-LLM の組み合わせが感情シーンを汎用の励まし文へ崩さずに扱えるか、教えてはくれません。

私たちは agent 編成システム と 言語モデル を一緒に評価するベンチマークを作っています。結果は組み合わせ単位で出す:「モデル X を agent システム A で動かすと Y 点;同じモデルを B で動かすと Z 点」。評価する次元:

  • セッションをまたいだキャラクターの一貫性

  • 長期記憶の検索

  • プレイヤー不在時の世界シミュレーション

  • 感情インタラクション

  • arc 単位のナラティブ制御

  • マルチキャラの協調

アウトプットは 1 枚の地図:どの agent-LLM 構成がどのロールプレイシーンに向くか、数字で裏付けられたもの。

最終的にどこへ向かうか

AI-native のゲームは、孤立したチャットボット会話ではなく、生きている世界に感じられるべきだ —— 連続的で、自らの動きを持ち、プレイヤーが何をしたかを覚えている。プロトコル、互換層、ベンチマーク、すべて同じ目標のため:小規模チームが届く下限を底上げし、上限は OSS エコシステムが押し上げ続けられるようにする。

それぞれが形になり次第、もっと話します。

Ludic Dynamics
Ludic Dynamics 東京からAI駆動の世界を構築。