你让一个投资模型每天调仓,它可能在历史数据里表现很好,一到真实市场却动作飘忽:仓位变化太大,交易成本吃掉收益,甚至抓住的只是过去碰巧出现的规律。这正是组合强化学习的难处。强化学习(RL)让模型根据状态、动作和奖励学习连续决策;放到投资里,动作是调仓,奖励通常同时考虑收益、风险和成本。但金融模型不能像游戏程序那样反复试错,只能从已有数据中学习,也就是离线强化学习。
Igor Halperin 与 Andrey Itkin 于 2026 年 7 月 16 日提交的论文,尝试给这种学习加一副“结构骨架”。他们提出 Scientific Physics-Informed Reinforcement Learning(SciPhyRL),面向大型机构投资者做动态组合优化。核心想法不是让神经网络只凭历史数据自由拟合,而是把最优控制问题中的已知方程一并塞进训练过程。
这条路线很有意思,但证据需要克制看待。当前材料实际只披露了论文摘要,没有具体绩效数字、实验参数和消融结果。以下效果均是作者自己的报告,尚无独立信源交叉验证。
它给组合学习加了什么约束?
SciPhyRL把投资过程写成连续时间问题,并扩展模型看到的“状态”:除了市场和仓位,还明确纳入累计成本。这样,模型考虑的不只是下一步可能赚多少,也要记住此前为了调仓已经付出了多少。
论文借用了 HJB equation,即 Hamilton–Jacobi–Bellman 方程。它把多期决策写成一种连续关系:今天怎么选,要连同未来还能取得的最优价值一起考虑。对组合管理来说,这意味着今天的仓位不是孤立动作,而是整条未来投资路径的一部分。
问题在于,直接求解这类方程并不轻松。作者的关键处理,是把 HJB 方程投影到已经观察到的市场轨迹上,将它转成 pathwise Hamilton-Jacobi equation。可以把它理解成:不试图一次画出整个市场里所有可能路线的地图,而是先沿着历史数据实际走过的路径,检查每一步是否符合那套最优决策关系。
接着,SciPhyRL使用 PINN——物理信息神经网络——从数据中求解。PINN训练时既要求网络贴合数据,也要求结果满足给定方程或约束。在这里,“物理”并不是说资产价格服从某条自然定律,而是借用物理建模的办法,把优化问题的结构先验写进学习目标。
作者称,这套方法只需一次离线扫描,省去传统的 value iteration 和 policy iteration。两者都是反复更新“未来价值”或“行动规则”的迭代方法。不过,摘要没有给出计算量、训练时间或收敛表现,因此还不能判断所谓 single offline sweep 在实际部署中节省了多少成本。
为什么把交易速度改成目标仓位?
连续时间模型通常可以把控制变量写成 trading rate,也就是持续决定交易速度。但实际投资期限可能很短。若模型慢慢向目标靠拢,信号还没兑现,机会可能已经过去。
SciPhyRL因此把控制变量改写为离散的 target holding——模型直接选择目标仓位。作者称,这能让组合立即到达信号所指向的位置。与此同时,每次调整并非免费:执行成本通过 quadratic price impact model 计算,即用二次形式描述交易规模增加后价格冲击如何放大。论文称该模型以市场微观结构为依据,但摘要没有披露公式、参数或校准方式。
整套逻辑由此连起来:信号告诉模型可能想持有什么;HJB结构要求它考虑跨期影响;累计成本提醒它过去和现在的调仓代价;目标仓位则让策略能在短期限内落地。
实验说明了什么,又没说明什么?
作者在一个包含 14 只 ETF 的资产池上评估方法,并使用 engineered oracle signal——人为构造、质量已知的“先知信号”。这类设置适合检查一个问题:如果输入确实包含可预测信息,优化器能否把它转换成考虑成本、风险和多期影响的仓位。
按照论文摘要,学习得到的 learned Gibbs policy 在样本外 Sharpe ratio 上显著优于 static 和 myopic baselines。Sharpe ratio衡量承担单位波动风险后获得的回报;static baseline是基本不随新信息动态调整的策略,myopic baseline则更关注眼前一步,而不充分考虑后续影响。摘要还声称,SciPhyRL能严格控制波动率与换手率,并将已知信号质量转成稳健、跨期、考虑成本的配置机制。
但材料没有给出具体 Sharpe ratio,也没有披露提升幅度、样本期、交易成本参数、波动率、换手率或统计显著性。“substantial improvements”“robust”“strictly controlled”因此只能视为作者的结论性表述,暂时无法量化核查。摘要也未解释 Gibbs policy 的具体形式。
真正值得关注的是验证框架
这篇工作的价值,不只在于又提出一个组合模型。它把数据拟合、动态控制、累计成本和执行约束放进同一套学习框架,试图解决机构投资中几个经常互相冲突的目标:抓住信号、少付成本、控制风险,同时避免只顾下一步。
更重要的是,它提出了一个值得继续检验的方向:当离线 RL 不能进入市场探索、又容易在历史数据里学到偶然规律时,加入结构先验,是否能缩小模型随意发挥的空间?PINN与路径上的 HJB 约束,至少在设计上提供了这种可能。
不过,“物理先验让组合 RL 更稳”目前仍是问题,不是结论。这里的“稳”也可能指四件不同的事:训练过程更容易收敛、样本外绩效波动更小、风险与换手约束执行得更好,或面对市场分布变化时更不容易失效。现有摘要没有把这些含义逐一验证。
局限与未知
- 实验使用 engineered oracle signal,可能预先注入了可预测性。结果不能直接外推到真实、嘈杂且会衰减的市场信号。
- 14 只 ETF 的单一资产池不足以证明普适性;摘要也没有提供样本期、成本参数和具体指标。
- 论文未报告消融实验,也没有与“不含物理先验、其余设置相同”的 RL 方法比较。因此,改善究竟来自 HJB/PINN、oracle signal、目标仓位改写,还是成本模型,目前无法拆开判断。