观察:规模的数字变了,难题的性质也变了

如果把公开研究里的几个节点排在一起,会看到一条很清楚的规模线。早期的 Generative Agents 工作里,25个智能体生活在名为 Smallville 的沙盒小镇;而清华大学团队的 AgentSociety 把规模推到了一万多个智能体,约五百万次交互。

从二十五到一万多,不只是数量级的差别。小镇里的问题是“一个角色能不能显得可信”,能不能记得昨天的对话、按计划行动、自发协调一场情人节派对。城市规模的问题则变成了另一类:成千上万个可信的角色放在一起,社会层面的现象会不会出现,算力和验证能不能承受

我们把这个变化当作一条值得持续关注的动态,因为它直接关系到 AI模拟人生 这条产品线:游戏里的虚拟城市,也会面对同样的规模问题,只是目标不同。

证据一:小镇里,记忆与反思让个体可信

Generative Agents 论文的贡献,是给LLM驱动的智能体一套可以运转的架构:

  • 记忆流:用自然语言记录观察、计划和反思。
  • 检索:按相关性等因素,从记忆流中取回当前需要的部分。
  • 反思:把零散观察提炼成更高层的认识。
  • 计划:据此安排一天的行动,并在情境变化时调整。

在这个架构下,智能体自发协调了情人节派对:有人发出邀请,有人互相转告,有人到场。它的意义在于说明,个体层面的记忆与规划,可以推动出群体层面的协作。但它的规模是几十个,交互可以被逐一审视,成本也还在可以讨论的范围内。

证据二:城市里,社会现象成为研究对象

AgentSociety 是一套大规模LLM驱动智能体的社会模拟器,被置于逼真的城市、社会和经济环境中,生成了一万多个智能体、约五百万次交互。研究者用它去复现和探讨一些现象,包括意见极化、全民基本收入的影响,以及外部冲击下的反应。

这里的重点,是从“看一个人像不像人”转向“看整个系统的行为”。研究者关心的是意见如何在群体里扩散、政策变化如何传导。但也必须说清楚:这是研究性的社会模拟,用来观察机制、检验假设,研究性模拟不等于预测现实。一座模拟出来的城市里发生了什么,不能直接当作真实社会的推断。

证据三:成本,是规模化绕不开的账单

规模每扩大一级,第一个撑不住的往往是成本。Affordable Generative Agents 指出,频繁调用大模型的花费很高,并提到 Stanford Town 研究的成本高达数千美元;它提出了分层决策、异步自我监控和“总结并遗忘”的记忆机制来降低调用成本,论文自述最多可降低约两个数量级。

这几条方法的共同点,是不让所有智能体在所有时刻都使用最昂贵的推理:常规的行为交给低成本的选项,只有需要新决策时才调用大模型,历史经历被总结后逐步遗忘。这个方向与游戏里的做法高度一致,也正是 一万个AI人物如何避免算不动 所讨论的核心。

对产品设计的启发:我们怎么读这些研究

把这几条线索放进大发娱乐的模拟人生设计里,会得出几点倾向。

  1. 先把状态结构化,再谈规模。 人物的收入、家庭、关系这些量应由系统维护,大模型只负责在关键时刻表达和抉择。这样即使规模变大,社会的因果依然可以被检查。
  2. 精度跟着关注度走。 玩家附近的角色使用完整的记忆与规划,远处的角色以家庭、街区为单位聚合,低频推进。
  3. 目标是可信与有趣,而不是复现现实。 研究里的社会模拟为了验证假设,需要贴近现实;游戏里的模拟为了让玩家理解和参与,需要因果清晰、前后一致。两者的评价标准不同,不能互相替代。
  4. 让玩家能看到“为什么”。 一件事在城里传开,玩家应能追溯经过了哪些人、哪些规则,而不是面对一个黑箱结果。

需要强调,这些是我们的设计倾向,不是对已有成果的宣布。文中提到的数字,除研究已公开的部分外,都不代表大发娱乐的实际规模。

还没解决的问题一:怎么验证“像不像社会”

规模变大以后,最难的也许不是跑得动,而是怎么知道它跑得对。一万个角色、五百万次交互,没有人能逐条阅读。

研究里常见的做法,是用整体现象作参照:看意见分布、资源分配、传播规律是否与已知的社会规律大致吻合。但这样做有天然的局限:吻合不等于正确,也许只是碰巧;不吻合也不一定意味着错,也许模拟的正是一个不同的假设情境。

对游戏来说,验证的标准更朴素:行为是否前后一致,事件是否有因果,回放能否复现。我们倾向于把可回放的日志和抽样复盘作为基本功,而不是急于宣称某个结论。

还没解决的问题二:一万个角色的行为一致性

单个角色在长时间运行后可能出现“人设漂移”:性格逐渐变弱,事实混乱,甚至把不同角色的状态混在一起。规模扩大后,这个问题会被放大:一万个角色里,只要有一小部分漂移,整个社会的结构就可能悄悄变形。

相关的研究方向包括把静态设定与动态经历分开存储、用事件感知的记忆结构降低混乱。这些思路在游戏里也很自然:人设是锚点,经历是变量,两者要分开管理。但把它们扩展到大规模社会,还有不少工程问题需要慢慢验证。

还没解决的问题三:成本会不会永远是约束

分层与遗忘可以明显降低调用成本,但成本下降并不意味着约束消失。玩家期待的细腻程度、模拟的复杂度,都会随着可用预算一起上涨。也就是说,我们很可能长期处在“用有限预算换取尽可能可信的社会”的取舍里。

因此更合理的姿态是:不追求“所有人都高精度”,而追求“该精细的地方足够精细,其余的部分足够自洽”

说明:本文引用的是公开的研究成果,且仅作定性说明;文中未给出任何关于大发娱乐自身规模、效果或成本的数据。研究性社会模拟用于观察机制,不等于预测现实。

小结

从几十个到一万多个,智能体社会模拟的规模在变大,需要回答的问题也从“像不像人”变成了“像不像一个可以被检查的社会”。对游戏而言,这意味着把重心放在结构化状态、分层精度、可回放的验证上,让玩家看到的是一座因果清楚、前后一致的城市,而不是一堆会说话的角色。这条线索我们会继续关注。