Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.056 — 2026-08-29
PAPER H 2 约 8 分钟

0DTE波动率溢价,交给排序模型

让模型每天给8种卖沽与“不交易”排队,再用保证金和信心门槛把0DTE溢价变成仓位。

你面对八份当天到期的保险合约:卖哪一份,都可能赚到保费;选错一份,却可能在下午的大行情里集中亏损。更麻烦的是,有些日子最好的选择其实是一份也不卖。这篇论文要解决的,正是这个日常但棘手的问题:不直接猜每份期权能赚多少钱,而是让模型每天给候选交易排队,并把“不交易”、保证金和盘中风险一起放进决策。

研究对象是 S&P 500 weekly options(SPXW)的 0DTE 期权。0DTE 指当天到期,剩余时间极短,价格与风险敞口可能在盘中迅速变化。卖方想赚的是波动率风险溢价——期权买家为防范未来波动而支付的补偿。但这不是无风险利息;突然的大行情会把平时积累的收益快速拿走。

本文所有结果均来自 Maciej Wysocki 的一篇 arXiv 论文,尚无独立复现、审稿结论或第三方验证。以下数字应视为作者报告的回测结果。

不猜收益,先决定谁更值得卖

传统做法容易把问题写成一道预测题:估计每份期权今天能赚多少钱,再选预测值最高的。论文换了一个角度,采用横截面学习排序(learning-to-rank):模型不必报出精确收益,只需判断同一天哪些候选相对更好。

这像是选餐厅。你未必能准确预测每家店会打多少分,但仍可能可靠地排出先后顺序。对噪声很大的日内收益来说,排序比猜一个精确数字更贴近交易任务。

每天 10:00 ET,模型面对九个候选:八个按 delta 目标选出的 SPXW 卖出看跌期权,以及一个 SKIP。delta 在这里可理解为期权价格对标的变动的敏感程度;不同 delta 大致对应不同执行价和风险位置。SKIP 则是明确的“不交易”选项。于是问题不再只是“卖哪一档”,而是先问“今天是否值得卖”。

排序器使用 LightGBM LambdaRank。LightGBM 是一种由许多决策树逐步纠错的模型;LambdaRank 则把训练重点放在候选次序,尤其重视榜首是否选对。模型每天只执行第一名,因此把学习资源集中在榜首,比改善列表末端更有实际意义。

不只看收盘,还看一路怎么走

训练标签也没有只看最终盈亏。论文以一分钟为间隔记录持仓路径,再计算 path-aware Sortino-on-bars label。Sortino 是一种只惩罚下行波动的风险调整指标;“path-aware”意味着它关心盈利是怎样走出来的。

例如,两笔交易收盘都赚 100 元。一笔全天平稳,另一笔盘中先亏 1,000 元再反弹。只看终点,两者相同;对真实账户来说,后者显然更危险。论文用交易最终盈亏作分子,以一分钟路径中的负向变化衡量下行压力。这样,模型会偏爱不仅赚钱、而且盘中更少受压的候选。

SKIP 的标签固定为零。它可以排在差交易之前、好交易之后,让模型学习在候选普遍不理想时空仓。

排名之后,才是能不能下单

论文没有把模型第一名直接等同于仓位。排名与执行之间还有两道关。

第一道是 confidence gate,即“信心门”。模型比较第一名和第二名的分数差。如果两者几乎打平,说明首选并不坚决,系统就放弃交易。这个门槛只用训练窗口末端的留出数据校准。不同窗口的交易率从 30.6% 到 100% 不等,说明它在部分阶段确实会拦下交易,而非装饰性的规则。

第二道是仓位管理。卖出期权需要预留保证金,极端损失也可能远高于收到的权利金。论文并行测试七种仓位方法,每种只校准一个自由参数,并统一接受保证金上限、分层费用和成交假设约束。说白了,排序回答“想买哪张票”,仓位层回答“账户最多买几张”。

回测还纳入指数期权保证金、分层费用,并假设在 bid 与 mid 之间成交。bid 是买方报价,mid 是买卖报价中点;bid-to-mid 并非保证能获得的真实价格,只是论文采用的执行条件。

留出2025年,结果有多亮

评估先在 2021—2024 年做四窗口 walk-forward。walk-forward 是按时间向前滚动:只用过去训练,再预测下一段,随后扩充历史重新训练。2025 年则被完整留作 out-of-time 样本,不参与训练、调参或模型选择。

据论文报告,七种仓位方法在 2025 年的年化 Sharpe ratio 为 4.31—5.76。Sharpe ratio 衡量单位波动对应多少超额收益,数值越高,历史上的风险调整表现越好。相比之下,2021—2024 年滚动测试范围为 1.90—3.11。headline method 的 Probabilistic Sharpe Ratio(评估观察到的 Sharpe 超过基准的统计可信度)为 0.964,论文所称样本期最大回撤为 -2.28%。

在 2025 年,每种方法相对 CBOE PUT、CBOE WPUT 和 SPX 买入持有三个被动基准,Sharpe 数值至少高 3.84;相对五个内部选择基线,至少高 3.69。这里说的是 Sharpe 的差值,不是收益率提高 384%。而且这些基准的期限、风险暴露和交易频率并不完全一致,不能把差值直接理解成同条件下的纯超额收益。

真正起作用的是哪一层

一组 2×2 消融实验分别开关 confidence gate 与尾部风险特征。在相对 CBOE PUT 的 5.59 点样本外 Sharpe 差距中,论文把 5.05 点归于排序器与选择层,两项风险控制合计对应 0.54 点。这是模型内部的归因,不代表各部分能够拆开、独立复制成同等经济收益。

更值得注意的是,2021—2024 年滚动测试呈现了不同画面:信心门会实际触发;两项风险控制单独使用都明显不及完整方法,二者结合才贡献了大部分效果。这提示风险控制不是简单相加,它们可能需要共同工作。

另一组十五类特征消融显示,移除 multiplicative regime interactions 后,滚动测试的统计信心“崩塌”。这类特征把单笔策略的风险暴露与波动状态相乘,让模型学习“同一种敞口在不同市场状态下意义不同”。论文没有在所给摘要中报告“崩塌”对应的具体统计量与显著性阈值,因此不宜把它写成精确的因果结论。

为什么值得关注

这项工作的价值,不只是一组很高的 Sharpe。它把四个原本容易分开的环节接在一起:同日不同执行价的横截面排序、明确的空仓选项、基于模型不确定性的拒绝交易,以及受保证金约束的仓位管理。对 0DTE 来说,这条链比单独提高预测准确率更接近真实交易。

作者称这是首个把横截面 learning-to-rank 端到端用于 SPXW 0DTE 曲面,并同时接入保证金仓位、拒绝机制和严格时间外检验的研究。这个“首个”属于作者主张;没有系统文献检索,无法独立确认。

局限与未知

  • 最亮眼的 4.31—5.76 Sharpe 只来自单个 2025 留出年。0DTE 日内收益可能带有自相关、偏态和厚尾,短样本年化后容易显得格外突出;PSR 0.964 也不能替代更长时期和独立复现。
  • bid-to-mid 是成交假设,不是可保证的成交价。滑点、市场冲击、压力期流动性、券商保证金差异、盘中追保与极端跳空,都可能让实盘结果弱于回测。
  • 论文所称 -2.28% 最大回撤的“样本期”在摘要中覆盖范围不够明确;完整策略的交互效果和特征消融也仍缺少第三方验证。

供稿材料 SOURCES — 1

← 返回 2026-08-29 · 量化板块