假设你一边端着水快走,一边又不想把水洒出来。你并不是先“只管速度”,再突然切到“只管平稳”,而是在每一步里不断调整两者的分量。Nature 的一项研究把类似问题搬进连续猎物追逐任务:当目标持续变化,人脑怎样兼顾多种追逐目标,又怎样随情势重新分配注意和动作?这件事值得关注,因为现实中的选择往往不是按一次按钮,而是边行动、边判断、边修正。
研究给出的核心解释是:大脑可能不会在两套方案中硬选一套,而会动态混合多套控制策略。不过,目前公开材料主要是论文摘要和同期 Research Briefing 的标题;样本量、效应量和统计检验等细节均未披露,以下机制性结论主要来自论文作者的模型拟合与神经活动分析。
“选择”也可以是调配比例
控制理论研究怎样根据当前状态不断调整动作,让系统靠近目标。恒温器根据室温开关暖气,就是最简单的控制过程。在追逐任务里,人需要根据目标的位置和变化持续修正行动。
这里的“控制策略”(control policy),指一套“看到某种状态,就采取相应动作”的规则,类似骑车时根据车身往哪边偏来调整车把。不同追逐目标可以各有一套策略。
研究团队用一种新开发的控制论方法分解参与者的连续追逐行为。他们发现,观察到的策略可以由一种层级模型较好地描述:底层有多个控制器,分别对应特定追逐目标;上层还有一个“元控制器”(meta-controller),负责决定此刻该怎样混合这些底层策略。
换句话说,大脑面对的不是简单的 A 或 B,而更像一张实时调音台:情势变化时,它会重新调节不同策略的权重。这就是“组合式控制”——多套方案可以同时贡献动作,只是各自所占分量不断改变。
三个脑区,可能各管一环
论文进一步把这种层级控制与三个脑区的神经活动联系起来。
海马(hippocampus)的神经元会编码并更新一种潜在的“策略状态”——也就是当前究竟以怎样的比例组合各套策略。作者认为,这种状态更新支持较早阶段的规划。在其提出的框架里,海马像一个状态估计控制器,帮助系统判断自己正处于哪种策略配置。
前扣带皮层(anterior cingulate cortex)的神经元,则能预测策略混合方式即将发生的重大变化。作者据此把它解释为元控制器:它不直接等同于某个具体动作,而可能负责重新调配底层策略。
眶额皮层(orbitofrontal cortex)的活动呈现出另一种模式。它更符合对任务当前“价值结构”的编码,也就是当下哪些结果更值得追求,而不是直接执行策略切换。于是,作者提出了一套三分工框架:海马估计策略状态,前扣带皮层调整策略组合,眶额皮层提供价值情境信号。
需要注意,这些措辞都很克制。论文摘要使用的是“可由模型较好描述”“能够预测”和“与某种编码一致”,并没有证明三个脑区各自承担确定且排他的因果功能。
为什么 AI 和机器人研究者会在意
强化学习,是让系统通过尝试动作并接收奖励或惩罚,逐渐学会更好做法。多目标强化学习还要在几个可能冲突的奖励之间权衡,例如既要快速抵达,又要少耗能、避开风险。
这项研究提供的跨学科参照在于:面对连续变化的多目标任务,可以不把决策理解成一次次硬切换,而把它设计成“多个专用控制器加一个动态调配者”。对机器人控制也一样,机器可能需要同时兼顾速度、稳定和目标变化。论文没有直接展示新的 AI 或机器人系统,也没有证明这套结构优于其他方案;它的价值更像是一种可供检验的设计思路:把目标专用策略、策略状态估计和价值情境分开处理,再让上层机制持续重新加权。
局限与未知
- “同时追逐两个目标”的证据限于连续猎物追逐这一实验情境,不能扩展成大脑可以同时执行任意两项任务。同期 Nature Research Briefing 的标题提供了表面印证,但现有材料无法确认它是否来自独立评论者。
- 公开摘要没有给出样本量、效应量、预测准确率、统计显著性和对照模型,因此无法判断模型优势有多大,也不能声称结论已获外部复现。
- 三脑区分工是与数据一致的解释框架,不是已经确立的因果地图。研究的预处理数据已发布于 Figshare,代码则公开在 GitHub 仓库 BCM-Neurosurgery/PreyPursuit,为后续核查和复分析留下了入口。