我们正在做一套协议、一套 benchmark,让 Claude Code 风格的 agent 编排能用于游戏 —— 模拟、角色扮演、叙事、世界模型驱动的体验。

重点不在再做一个 AI TRPG demo,而在这些游戏底下的运行时层:世界、角色、记忆、规则、叙事,由分工明确的 agent 一起协调;这种协调能像过去 20 年的游戏引擎那样被检视、被替换、被 benchmark。

三块工作。

agent 与 sub-agent 的协议

灵感来自 Claude Code 的 router → sub-agent 风格,适配的是游戏世界。协议要定义:

  • agent 之间如何通信 —— 消息形状、工具暴露面、状态交接

  • 责任如何划分 —— 谁读什么、谁写什么

  • 世界状态如何更新 —— 文件,还是结构化事件日志

  • 角色如何保持一致性 —— 每个角色的记忆布局

  • 自由度与叙事一致性如何平衡

今天这些以「约定」的形式存在 WorldLines 仓库里。要做的,是把它们抬升成别人能读、能实现、能反对的协议。

兼容更多 agent 系统与低成本 LLM

不想做「只能跑 Claude」的俱乐部。一回合丰富的角色扮演要组合几十个 agent 调用;如果每一次都得用最前沿的专有模型,账只对少数几家工作室算得过来。

具体来说:

  • 一层薄的 runtime 适配(Claude Code、OpenAI 兼容 API、本地 Qwen / Llama 系、未来的 agent SDK)

  • 按 agent 选模型 —— 叙事用强模型,规则判定用便宜模型

  • 一条可以不断推进的「质量/成本」前沿,而不是单一价位

同一套架构、不同后端、每场游戏成本随时间往下走。

agent × LLM 组合的 benchmark

公开 LLM benchmark 衡量角色扮演关心的能力只能间接——回忆、数学、代码、指令跟随。没有哪个告诉你:这个模型能不能让一个 NPC 在 40 场之后还保持一致,某一组 agent-LLM 处理情感戏会不会塌成「鼓励语」。

我们做的 benchmark 同时评估 agent 编排系统 与 语言模型。结果按组合发布:「模型 X 在 agent 系统 A 下得 Y 分;同一个模型在 B 下得 Z 分」。要测的维度:

  • 跨场次的角色一致性

  • 长期记忆检索

  • 玩家不在场时的世界仿真

  • 情感互动

  • 一个 arc 跨度的叙事控制

  • 多角色协调

产出:一张地图 —— 哪些 agent-LLM 组合最适合哪些角色扮演场景,背后有数字。

这件事最终的方向

AI-native 的游戏应该不像一段孤立的聊天对话,而更像一个真实的世界 —— 持续、有自己的意志、记得玩家做过什么。协议、兼容层、benchmark,做的都是同一件事:把小团队能做出的下限抬高,把上限交给开源生态继续往上推。

等每一块落地,再说更多。

Ludic Dynamics
Ludic Dynamics 从东京打造 AI 驱动的世界。