MindTrace让记忆真正影响角色行动
技 术 报 告 · 2026 年 8 月
Ao Tang, Yong Qiao
摘 要
长时间运行的社会模拟有一个常见问题:角色一开始各不相同,后来却越来越像。仅靠人设和不断累积的对话,很难保留真正影响行为的经历差异。MindTrace 为此把“世界里发生了什么”和“每个角色怎样记住这件事”分开保存。同一件事可以在不同角色那里留下不同来源、不同可信程度、也不同容易被想起的记忆。
MindTrace 把事件、记忆、决策和行动连接成一个闭环。事件形成个人记忆,记忆参与决策,行动成为新的事件;真正影响过行动的记忆,也会因此更容易再次被想起。系统还会根据证据是否充分,决定角色可以直接行动还是应当先求证。由 9 个角色组成的 30、120 和 240 步连续模拟,依次观察到完整闭环、重要性回看、记忆进入沉寂、被线索重新唤回,以及角色表达自己是否记得或是否确定。
关键词 长期记忆 · 社会模拟 · 信息来源 · 记忆唤回 · 证据门槛 · 注意力调度
引言
角色为什么会越来越像
社会模拟运行得越久,越需要角色在同一个世界里形成不同的人生轨迹。但人设只能提供起点,行动模板也只能限定表面形式。随着共享信息不断增加,角色容易重复相似的行为,彼此之间的差异也会逐渐缩小。一项覆盖多种模型和四十个模拟日的研究观察到了较高的连续行动重复率 [1]。
真正拉开角色差异的,是他们各自怎样经历和使用信息。比如,社区会议临时取消:有人亲眼看到了官方通知,有人只是听邻居转述,还有人仍然记得原来的安排。三个人谈的是同一场会议,却掌握着不同来源、不同可靠程度的信息。如果系统只保存一句“会议取消了”,这些差别就全部消失了。
MindTrace 不把记忆当作不断追加的文本,而把它当作会随时间和使用方式变化的内部状态。它关心三个问题:一件事怎样成为带有来源的个人记忆;当前证据足以支持多大后果的行动;一条记忆真正影响行动之后,未来会发生什么变化。
主要贡献
- 共同事件与个人记忆分开保存。世界只保留一份事件记录,每个角色则形成自己的记忆。亲历、目击、转述、误解和后续修正不会被压成同一段文字。
- 记忆会随时间和使用发生变化。长期不用的记忆会逐渐淡出;真正参与决策、被别人再次提起或被相关情境唤起的记忆会得到强化。
- 行动后果越大,证据要求越高。证据不足时,角色不会直接执行难以撤回的行动,而会先查看原始信息、询问当事人或等待新的独立来源。
- 注意力决定这一刻能处理多深。角色会根据清醒时间、活动量和信息的重要程度,选择完整处理、简化处理或暂时跳过。
一眼看懂 MindTrace
MindTrace 只有三个核心部分:世界、记忆和决策。世界记录实际发生的事件;每个角色从自己的位置形成个人记忆;被想起的记忆参与决策;完成的行动再回到世界,成为所有人可能观察到的新事件。除此之外,系统还会更新那些真正影响过行动的记忆。注意力调度只决定每一步处理得多细,不改变这个先后顺序。图 1 展示完整闭环,表 1 说明每一步要解决的问题。
还是以会议取消为例:官方通知属于世界事件;亲眼看到通知和听邻居转述,会形成两条来源不同的个人记忆;角色据此改变安排,又会产生新的世界事件;真正促成这次改动的记忆则会得到强化。
| 过程 | 要回答的问题 | 得到什么 |
|---|---|---|
| 世界 → 记忆 | 这个角色是怎样知道这件事的? | 带有来源和时间的个人记忆 |
| 记忆 → 决策 | 此刻想起了什么,证据足以支持行动吗? | 被唤回的记忆和行动判断 |
| 决策 → 世界 | 角色的决定怎样变成其他人也能观察到的新事件? | 按时间写入的世界事件 |
| 决策 → 记忆 | 这次行动真正使用了哪些记忆? | 更新后的易想起程度和使用记录 |
| 注意力调度 | 这一刻能处理得多深入? | 完整、简化或跳过 |
同一件事,为什么会留下不同记忆
世界只有一份事件,角色各有一份记忆
世界里的事件按照发生时间保存,为所有角色提供同一条时间线。个人记忆不会照抄这条记录,而是保留角色接触事件的方式:亲自做过会形成第一手记忆,亲眼看到会形成目击记忆,听别人转述则会记录“谁告诉了我”和“这条消息最初来自哪里”。因此,不同说法可以指向同一件事,同时继续保留各自的来源(图 2)。
系统分别记录“这是哪一件事”和“我是怎么知道的”。前者用来合并同一事件的重复出现,后者用来区分亲历、单次转述和多个互相独立的来源。认知心理学把这种记住信息出处的能力称为来源监控;在 MindTrace 中,它直接决定一条信息应当被视为经历、转述还是推断。
记得,不等于现在仍然成立
角色可能一直记得“会议取消了”,但后来会议又重新安排了。这条旧记忆仍然属于角色的经历,却不能继续支持现在的行动。MindTrace 因此把“过去确实这样认为”和“现在仍然成立”分开保存。由多条记忆得出的结论,也会记录自己依赖了哪些证据;其中一条失效时,结论就要重新检查。这种处理方式承接了真值维护系统中对长期保留信息和依赖关系传播的研究 [2]、[3]。
记忆如何淡出,又如何回来
用“可及性”表示有多容易想起
一条记忆不应当永远同样清晰。MindTrace 用“可及性” a 表示它此刻有多容易被想起。活跃记忆可以自然出现;沉寂记忆需要明确线索才能回来;不可召回则表示它已经离开当前的记忆生命周期。这里描述的是“能不能想起”,不是“内容对不对”:活跃记忆也可能是错的,沉寂记忆也可能保留着真实的过去。
记忆会逐渐淡出。时间每经过一个有效半衰期 H(m),当前可及性就减半。
- a(m)
- 记忆 m 此刻有多容易被想起,范围为 0 到 1。
- m
- 一条具体记忆。
- Δt
- 从记忆上一次被使用或重新唤起之后经过的模拟时间。
- H(m)
- 记忆 m 的有效半衰期,单位与 Δt 相同。
如果所有记忆都使用同一个半衰期,它们就会以相同速度淡出。MindTrace 会让重要或被反复强化的记忆保留得更久:
一条记忆越重要、越经常被强化,它保持清晰的时间就越长。
- H0
- 基准半衰期;本文实验取 72 个模拟小时。
- imp(m)
- 记忆 m 的重要性。
- imp0
- 重要性量表的基准点;缺少重要性信息时,两者之比取 1。
- R(m)
- 由重复接触、实际使用和独立来源共同形成的记忆强化量。
每次强化都有作用,但次数越多,新增一次带来的变化越小。
- d
- 再次接触同一事件的次数。
- u
- 记忆被决策实际使用的次数。
- s
- 独立提到该事件的不同来源数量。
- σ(n)
- 把非负计数映射到 0 与 1 之间的饱和函数。
当 a ≥ 2−3 时,记忆处于活跃状态;当 2−5 ≤ a < 2−3 时,记忆进入沉寂;当 a < 2−5 时,它变得不可召回。因为衰减以 2 为底,这两道边界分别出现在三个和五个有效半衰期之后(图 3)。
从想起一件事,到决定是否行动
两种唤回方式
平常想起一件事,需要同时满足两个条件:它与眼前的问题有关,而且它此刻还比较容易被想起。MindTrace 把这两个值相乘:
只有既与当前情境相关、此刻又容易被想起的记忆,才能得到较高分数。
- score(m, q)
- 记忆 m 对当前查询 q 的召回分数。
- rel(m, q)
- 记忆内容与当前查询之间的语义相关性。
- a(m)
- 式 (1) 定义的“此刻有多容易想起”。
- q
- 由当前感知、目标和行动上下文形成的查询。
明确线索走另一条路。如果眼前的信息直接指向某个旧事件,系统可以绕过普通排序,把对应记忆重新带回来。记忆研究把这种现象称为线索触发的回忆 [4]。第一条路径负责“自然想到”,第二条路径负责“受到提醒后想起”。一条记忆回来之后,还可以沿着已有联系继续带出相关内容 [5]。
行动后果越大,证据要求越高
想起一件事,不代表可以立刻据此行动。MindTrace 用四项信息判断当前证据是否充分(表 2),并把行动分为可逆、可核验和难以撤回三类。行动越难撤销、越难检查,证据门槛就越高(图 4)。
| 检查项 | 要回答的问题 | 怎样影响行动门槛 |
|---|---|---|
| 来源 | 这是第一手经历、直接观察还是他人转述? | 第一手材料可承担更高证据权重 |
| 独立来源 | 有多少互不依赖的来源提到同一事件? | 区分真正的交叉确认和同一消息的重复传播 |
| 当前有效性 | 这条信息现在仍然成立吗? | 过时内容继续保留为历史,但不能支持后果较大的行动 |
| 来源可靠度 | 这个来源过去提供的信息是否可靠? | 调整转述信息能够承担的证据权重 |
证据不足时,系统不会直接执行后果较大的行动,而会先减少不确定性。例如,听说会议取消的角色可以查看官方通知、询问组织者,或者等待另一个独立来源。求证本身会产生新的第一手事件,随后形成新的记忆,并可能为之后的行动提供足够证据。
行动也会反过来改变记忆
每次行动都会回到世界
角色完成一次行动后,它就会成为新的世界事件,也可能进入其他角色下一次观察的范围。系统直接根据行动本身判断后果:存在明确反向操作的行动属于可逆;可以通过新的观察确认结果的行动属于可核验;会改变他人状态、又没有直接反向操作的行动,则属于难以撤回。这样,证据门槛就和行动在世界中真正造成的影响保持一致。
只有真正用过的记忆才会得到强化
每次决策都会记录哪些记忆真正支持了行动。只有这些记忆会得到更新;只是出现在候选列表里,并不会自动变得更牢固。更新会增加式 (3) 中的 u,重新计算有效半衰期,并从当前可及性开始新的衰减轨迹。换句话说,一条记忆真正被用过之后,会更可能在未来再次被想起。
记忆也可以在没有直接参与行动时恢复。他人再次提到同一件事,会增加重复接触次数 d;新的独立来源会增加 s;与旧事相关的情境也可能把它间接唤起。于是,记忆既可以因为使用而变得稳定,也可以被新信息带回来,同时继续保留自然淡出的可能。
底层证据变化时,结论也要重新检查
一个结论可能来自多条记忆。MindTrace 会保留这些依赖关系:其中一条变得过时或进入沉寂时,相关结论就要重新检查。如果后来恢复了完整证据,结论可以重新用于决策;如果关键证据仍然缺失,它会继续留在个人历史中,但不能支持后果较大的行动。
注意力决定这一刻能处理多深
注意力预算
角色不应当在每一个时刻都进行同样深入的思考。MindTrace 把注意力看作每天有限的处理预算:清醒时间决定总容量,行动和新到信息会消耗预算,睡眠再按照角色自己的作息把它恢复。
时间划分决定每小时能够处理多少;清醒时长决定一天的总预算,睡眠时长决定恢复速度。
- Δslot
- 一个时间槽的分钟数;本文实验取 10 分钟。
- C
- 每个模拟小时包含的时间槽数量;本文为 6。
- Afull
- 角色一天可以使用的完整注意力预算。
- hwake
- 日常清醒时长。
- hsleep
- 日常睡眠时长。
- rrecover
- 每个睡眠小时恢复的注意力。
行动占用的时间构成主要消耗,新到的信息还会带来一部分额外处理成本。
- costhour
- 当前模拟小时的注意力消耗。
- activity
- 由行动与到达信息形成的活动量。
- durationmin
- 每个已执行行动的持续分钟数。
- arrivals
- 当前小时内需要处理的新信息数量。
- clamp(x, 1, C)
- 把活动量限制在最低基础消耗与每小时容量之间。
完整处理、简化处理和跳过
简化处理,⅓ ≤ α < ⅔
跳过,α < ⅓
剩余注意力决定这一环节采用完整处理、简化处理还是跳过;特别重要的信息最多可以把处理提高一个等级。
- α
- 当前注意力占满预算的比例,范围为 0 到 1。
- mode(α)
- 当前认知环节采用的处理等级。
- ⅔ 与 ⅓
- 把完整的一日注意力预算等分为三个区间的边界。
简化处理仍然保留最低限度的有效结果,例如少想起几条记忆,或者继续执行已有计划,而不是从头权衡。跳过时,系统会记录原因是睡眠、行动尚未结束,还是注意力不足。信息越新、与角色关系越直接、越与现有认识冲突,就越值得优先处理。调度器只负责选择处理等级,每个认知环节再自行决定怎样完成“简化处理”。这种分工沿用了黑板式调度系统中各模块保持独立的思路 [9]。图 5 展示一个角色一天里注意力的消耗、恢复与处理等级的切换。
机制验证
实验设置
连续模拟包含 9 个角色,每一步代表一个模拟小时,分别运行 30、120 和 240 步,大约对应 1.25、5 和 10 个模拟日。随着模拟时间增长,短时闭环、重要性回看和完整的记忆状态变化会依次进入可观察范围(表 3),由此可以检查各项机制怎样连接并共同运行。
| 长度 | 角色 × 步数 | 主要观察 | 代表性读数 |
|---|---|---|---|
| 短程 | 9 × 30 | 完整闭环开始运行;求证形成第一手证据 | 5,288 个世界事件;405 次使用后记忆更新;17 次高后果行动判断 |
| 中程 | 9 × 120 | 重要性回看启动;注意力出现混合处理等级 | 367 次重要性回看;127 次简化处理 |
| 长程 | 9 × 240 | 活跃—沉寂—返回的循环出现;角色开始表达自己的记忆状态 | 525 次进入沉寂;219 次线索唤回;290 次关联情境唤回;116 次记忆状态表达 |
不同时间长度出现了什么
30 步模拟已经足以展示从证据到行动的完整闭环。17 次需要检查证据的高后果行动中,9 次达到门槛并继续执行,8 次转为求证。继续执行的 9 次行动里,有 2 次使用了角色先前主动求证形成的第一手记忆。求证由此成为后续决策的新证据来源。
120 步模拟进入默认半衰期的回看窗口,记忆的重要程度开始影响之后淡出的速度。240 步模拟跨过三个有效半衰期,完整状态循环开始出现:525 条记忆进入沉寂,219 条被明确线索唤回,290 条被相关情境间接带回。944 次重要性判断中,有 349 次延长了记忆之后的半衰期。它们出现的先后顺序与式 (1) 到式 (3) 的预测一致(图 6)。
验证结果
三种时间长度共同展示了 MindTrace 的完整运行过程:事件形成带来源的个人记忆,记忆按照相关性和可及性进入召回,证据门槛决定继续行动还是先求证,实际使用再强化未来更可能被想起的内容。随着时间继续推进,重要性、沉寂、线索唤回、情境唤回和记忆状态表达也按照设计顺序出现。
相关工作
长期智能体记忆研究大多关注三件事:怎样写入、怎样压缩、怎样检索。MindTrace 从检索之后继续追问:一条被想起的内容,证据是否足以支持行动?它真正参与行动之后,未来还会不会更容易被想起?已有研究发现,只在需要时介入记忆,可能比持续向上下文注入记忆更有效 [6];受人类记忆启发的架构,也把记忆逐渐稳定和取出后的重新巩固视为关键过程 [7]。
记忆逐渐淡出、受到线索后重新出现,以及一条记忆带出相关内容,都能在记忆心理学和认知模型中找到对应研究 [4]、[5]。底层证据变化后重新检查结论,来自真值维护系统处理依赖关系的思路 [2]、[3]。注意力调度借鉴了黑板式系统中各模块保持独立的原则 [9];完整思考和沿用既有行为之间的区别,则与双加工理论和习惯研究相呼应 [8]、[10]。
结论
MindTrace 让记忆成为社会模拟中真正会改变后续行为的内部状态。世界记录发生过什么,角色保留自己怎样知道这件事;可及性决定什么更容易被想起,证据充分度决定当前可以采取什么行动,实际使用又会改变未来的记忆。注意力预算进一步限制每一刻能处理多深,让思考在模拟时间里也需要付出成本。
机制验证表明,求证可以为之后的行动创造第一手证据;重要或经常使用的记忆会淡出得更慢;进入沉寂的记忆可以被线索或相关情境带回;角色也能够表达自己是否记得、是否确定。MindTrace 由此展示了一条清晰路径:角色差异可以从各自经历了什么、相信了谁、做过什么,以及哪些记忆真正影响过行动中持续生长。
· · ·
参考文献
- AutoPersonas. arXiv:2607.08252, 2026.
- Doyle, J. A Truth Maintenance System. Artificial Intelligence, 1979; 12: 231–272.
- de Kleer, J. An Assumption-Based Truth Maintenance System. Artificial Intelligence, 1986; 28: 127–162.
- Semon, R. Die Mneme. 1921.
- Collins, A. M., & Loftus, E. F. A Spreading-Activation Theory of Semantic Processing. Psychological Review, 1975; 82: 407–428.
- Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents. Preprint, 2026.
- Human-Inspired Memory Architecture for Language-Model Agents. Preprint, 2026.
- Evans, J. St. B. T., & Stanovich, K. E. Dual-Process Theories of Higher Cognition: Advancing the Debate. Perspectives on Psychological Science, 2013.
- Erman, L. D., Hayes-Roth, F., Lesser, V. R., & Reddy, D. R. The Hearsay-II Speech-Understanding System: Integrating Knowledge to Resolve Uncertainty. ACM Computing Surveys, 1980; 12(2).
- Wood, W., & Neal, D. T. A New Look at Habits and the Habit–Goal Interface. Psychological Review, 2007; 114: 843–863.