Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER H 24 约 7 分钟

把希腊字母写进神经网络

把 Delta 风险直接写进训练目标,让期权神经网络学会赚钱时也学会管敞口。

你让一个交易模型只按收益率拿分,它很可能找到一条“成绩很好、风险难看”的捷径。比如,一组期权开仓时明明接近方向中性,持有几天后却悄悄变成押注股价涨跌。回测收益还在,策略的风险来源已经变了。

论文 Taming the Greeks: Option Portfolios with Inductive Biases 想解决的正是这个问题:不等模型生成仓位后再检查风险,而是在训练阶段就惩罚不想要的风险敞口。说得直白一点,神经网络不仅要学会“怎样赚钱”,还要同时学习“哪些钱不能靠方向暴露来赚”。本文的效果数字与结论均来自这篇论文,尚无第二个独立信源交叉验证。

开仓中性,不等于一路中性

论文研究的是 straddle——同时持有执行价相同、到期日相同的看涨和看跌期权。作者每月为 Nasdaq 100 成分股选择接近平值、即执行价接近股价的合约,并在开仓时调整两条腿的权重,使组合接近 Delta 中性。

Delta 是期权希腊字母(Greeks)之一。Greeks 把复杂期权组合翻译成一组可监控的风险敏感度:Delta 衡量期权价值对标的价格小幅变动的敏感度,Vega 对应隐含波动率,Gamma 描述 Delta 随股价变化的速度,Theta 则对应时间流逝。

Delta 中性意味着,标的价格小幅变动时,组合价值最初不会明显偏向上涨或下跌。但这不是永久保险。论文中的组合只在建立时做一次中性化,之后固定看涨和看跌期权的权重,直到到期,不再动态再平衡。股价偏离初始执行价后,组合的 Delta 会漂移;一条腿逐渐进入价内,原本主要体现波动和曲率的 straddle,可能越来越像一个方向性仓位。

这也解释了论文标题里的“Taming the Greeks”:要驯服的不是开仓那一刻的 Delta,而是持有过程中逐渐长出来的方向风险。

把风控写进评分表

作者采用 LSTM——一种处理时间序列的神经网络——直接把市场特征映射成交易信号和仓位。输入包括不同周期的标准化收益、MACD 趋势指标、期权的价内外程度、剩余期限,以及 Delta、Gamma、Theta、Vega、Rho 等风险敏感度。

普通版本只优化样本内的风险调整后收益,具体目标是 Sharpe ratio——用收益相对于波动的比例衡量策略表现。新框架则在这个目标旁边增加一项可微风险惩罚:所谓“可微”,就是这项惩罚能被训练算法计算梯度,从而知道应该怎样调整模型参数。

其思路可以简化为:

ℒ=ℒperformance+λℒrisk

第一项要求策略提高风险调整后收益;第二项惩罚指定的希腊字母敞口;λ 决定风控有多严。它是一种归纳偏置——预先告诉模型,我们偏好哪些解。在这里,模型不能只追逐历史收益,还要倾向于产生更容易解释和对冲的仓位。

这项设计与论文讨论的强化学习式对冲不同。后者通常通过模拟市场路径学习连续的对冲动作;这套框架完全使用历史数据,在同一个优化问题里同时决定交易信号、仓位大小和风险约束。

最大的陷阱,是模型干脆不交易

直接惩罚绝对 Delta 看似合理,却存在一个漏洞:Delta 敞口会随仓位一起缩小。模型最省事的办法不是改善仓位结构,而是把所有交易信号压到接近零。账面风险确实消失了,策略也基本不工作了。作者称之为 signal shrinkage,即信号收缩。

论文为此设计了两类惩罚。

第一类是 exposure-normalized penalty(ENP,敞口归一化惩罚)。它用总仓位规模去归一化 Delta,问的是“每单位交易活动带来了多少方向风险”。统一缩小全部仓位,不再能轻易降低这个比率。

第二类是 drift penalty(DP,漂移惩罚)。它观察 Delta 相对于 Gamma 的比例。平值附近的 straddle 通常有较明显的 Gamma;当股价远离执行价,Delta 上升而 Gamma 下降,仓位便更像方向押注。DP 因而对这类已经漂离平值区域、由方向风险主导的合约施加更高成本。两种方法都另有二次型版本,对较大的集中敞口处罚更重。

这里的“把希腊字母写进神经网络”是一种通俗概括。作者没有把字母改造成新的网络结构,而是把风险敏感度作为输入,并把相应惩罚写入训练目标。

收益没有因为风控必然下降

论文使用 OptionMetrics Ivy DB 的 Nasdaq 100 成分股期权数据,样本从 2010 年 1 月到 2023 年 12 月。作者保留标准月度期权,并剔除零买价、卖价不高于买价、违反美式期权套利边界或建仓日持仓量不为正等观测。模型按时间划分训练与验证数据,再用扩展窗口做样本外评估。

在不计交易成本的结果中,传统规则策略的年化 Sharpe ratio 为 0.621 至 0.822。只优化 Sharpe、没有风险惩罚的深度学习基线达到 2.131,但伴随持续的正向净 Delta 偏差和较高的总 Delta 敞口。

加入惩罚后,论文挑选出的最佳 ENP 版本 Sharpe 为 2.260;最佳 DP 版本达到 2.339,同时在表中取得所有模型里最低的最大回撤。后者相对未正则化基线高约 9.8%。这说明在作者的实验设定里,风险约束并非只能以牺牲收益为代价;适度约束还可能阻止模型依赖不稳定的方向敞口。

但比较边界要说清:优势是相对论文自己的未正则化深度学习基线,并不等于已经胜过所有传统策略、强化学习方法或真实交易系统。作者也只展示了各惩罚形式中表现最好的校准结果。

为什么值得关注

这项工作的价值,不只是一组更高的 Sharpe 数字。它正面回答了量化模型里一个更实际的问题:黑箱信号如何变成可对冲、可解释、可纳入风险限额的仓位。

传统流程常把预测、仓位配置和风控分开处理。模型先给信号,风险系统再削仓。这里换了一个角度:把风险经理关心的指标直接变成模型的评分标准。模型从训练开始就知道,收益来自哪里和收益有多少同样重要。

论文目前只惩罚一阶方向敞口 Delta,但框架原则上可以替换为 Gamma、Vega、Theta 或多种风险的组合。作者把多维希腊字母约束留给未来研究。真正值得继续观察的,是这种训练方式能否从“控制一个明确风险”扩展到现实交易台上相互牵制的多重限额。

局限与未知

  • 论文报告的是单一研究中的回测结果。供稿未给出关键结果的统计显著性,也不足以判断它在不同市场状态下是否稳定。
  • “适当校准”意味着结果依赖超参数选择;论文对每个正则化变体报告最佳模型,因此不能排除筛选最优配置带来的乐观偏差。
  • 上述核心比较未计交易成本。论文称另行加入换手惩罚并研究费用后表现,但现有材料没有提供相应数字,无法判断优势在真实摩擦下保留多少。

供稿材料 SOURCES — 1

← 返回 2026-10-02 · 量化板块