想比较两种治疗,最容易忽略的往往不是公式,而是时钟。比如,一组人在开始用药当天进入研究,另一组却要等到后来满足某个条件才被纳入。后者必须先“活到”那个时点,比较从起跑线开始就不公平。
目标试验模拟(target trial emulation)处理的正是这类问题。它不会把观察数据变成真正的随机试验,而是先写出一场理想试验应有的规则,再让现有数据尽量逐项对应。Hisashi Noma 于 2026 年 8 月 3 日提交的教程,介绍了如何用 R 包 TTE 把这套思路组织成一条完整工作流。本文信息均来自该论文,尚无独立信源交叉验证。
先把起跑线画清楚
目标试验模拟先要求研究者回答几个朴素的问题:谁有资格参加?比较哪些治疗策略?人在什么时候被分组?从哪一天开始随访?观察什么结局?
其中最关键的是时间零点(time zero)——资格确认、治疗分组和随访开始共同对齐的时刻。如果研究者先利用未来信息挑选参与者,过一段时间才开始计时,就可能凭空制造一段存活优势。论文认为,把纳入资格、治疗分配、时间零点和随访逐项对齐,可以减少这类本可避免的偏倚。
“减少”不等于“消除”。目标试验模拟仍然使用观察数据,没有真正进行随机分组。它只是把研究问题和时间顺序写得更明确,让分析不至于在含糊的规则上起步。
TTE 把哪些步骤串了起来?
这份指南覆盖从研究问题到不确定性估计的一整套环节。首先要决定估计什么效果,也就是 estimand——可以理解为研究真正想回答的那个量。
教程区分两种常见目标。intention-to-treat effect 关注按最初治疗策略分组后的效果;per-protocol effect 则关注遵循既定治疗策略时的效果。两者回答的问题不同,因此结果也可能不同。论文的示例专门演示了如何解释这种差异。
接下来是整理数据。TTE 同时涉及基线数据和 person-period 数据。后者把同一个人的随访拆成多个时间段,以便表示治疗、失访和结局随时间发生的变化。论文强调纵向权重的时间顺序:构造数据时,不能让后来的信息反过来影响较早的决定。
然后进入逆概率加权。它让较少见的治疗或随访路径获得更大权重,试图构造一个在已测变量上更可比的“伪总体”。教程介绍了稳定化治疗权重和失访权重,也包括权重截断——当少数人的权重过大时,对极端值加以限制。
但加权不是按下按钮就结束。指南还要求检查加权后的平衡,以及有效样本量。后者不是原始人数,而是权重不均衡后,数据实际还能提供多少信息。如果权重高度集中在少数人身上,表面样本很多,实际支撑可能很弱。
从相对差异看到绝对风险
结局分析部分使用加权的离散时间生存模型。生存分析研究的是事件何时发生;“离散时间”则把随访切成一个个时间段。教程进一步通过标准化,把模型结果转换为目标人群中的风险估计。
输出不只包括 relative hazards,也就是两组事件发生速率的相对比较,还包括 absolute risks——事件实际发生概率。相对指标适合比较差异,绝对风险更接近“会有多少人发生事件”这个问题。指南还介绍加权 Kaplan–Meier 和 Aalen–Johansen 估计,以及 cumulative incidence,即截至某个时间点事件已经发生的累计概率。
遇到竞争风险时,时间线还要再谨慎一层。竞争风险指某个事件一旦发生,就会阻止目标事件以后发生。例如研究心衰住院时,死亡会让此后的住院不再可能。它不能被简单当作普通失访。TTE 教程因此把竞争风险分析也纳入流程。
不确定性估计采用原始个体层面的 cluster bootstrap。bootstrap 是反复重抽样来观察结果波动;按原始个体成组抽样,则是为了保留同一个人被拆成多个时间段、甚至进入多个嵌套试验后形成的关联。
两个案例,更像演练而非证据
论文提供了两个完全合成的端到端示例。第一个比较起始使用 SGLT2 inhibitor 与 DPP-4 inhibitor 后的全因死亡。第二个构造序贯嵌套试验,比较 angiotensin receptor blocker 与 calcium channel blocker,并分析心衰住院及竞争死亡。
“序贯嵌套”可以理解为:随着时间推进,在不同合格时点依次启动多场小型模拟试验。示例展示了如何在 R 中估计并诊断相对风险速率、绝对风险和累计发生率,也展示了如何区分 intention-to-treat 与 per-protocol effects。
这里必须守住边界:两组数据都是合成的。它们用于演示工作流,不能当作相关药物真实疗效或安全性的临床证据。材料也没有报告样本量、效应值、置信区间、运行性能或与其他软件的量化比较。
为什么值得关注?
目标试验模拟常被概括成一句因果推断口号:把观察研究写成理想随机试验。真正困难的部分,却是把这句话落实到每一个决定——时间从哪里开始,治疗策略如何定义,纵向数据怎样展开,权重如何构造,极端权重怎样处理,平衡是否改善,竞争事件如何计入,最后怎样给出风险和不确定性。
这份教程的价值正在这里。它把这些相互依赖的选择放进同一条 R 工作流,也把诊断步骤和结果估计放在一起。它提供的不是“用了 TTE 就能得到正确因果答案”的保证,而是一套较为系统的检查清单和实现路径。
局限与未知
- 所有结论目前只来自论文作者的说明;材料没有提供外部复现或独立验证。
- 结果仍依赖一致性、可交换性、positivity、模型设定和权重诊断等识别条件。关键混杂变量没有记录或权重极端时,估计仍可能有偏或不稳定。
- 当前材料未给出 TTE 的版本、代码仓库、正式发布渠道和复现结果,也不能据此断言它比其他工具更准确或更好。