一篇文章经 AI 润色后,明明还是作者自己的内容,却可能被平台判成机器生成。Sebastian Raschka 的这份教程从这个尴尬场景出发,带读者从零搭建 AI 文本检测器:它根据文字的统计特征打出 0—100 分,表示文本与训练数据中“AI 生成”这一类别有多相似,而不是鉴定作者身份。
教程采用 DistilBERT 分类器,串起数据构造、评估、训练和本地部署,最后做成可供人或程序调用的 API,并配有浏览器界面;界面既显示全文分数,也能标出各段文字的得分。更有意思的是,作者还把检测器用作 verifier(自动评分员),通过 RLVR——用可自动核验的结果奖励模型——训练一个 SLM(算力需求较低、可在个人设备运行的小语言模型)写出更难被发现的文本。
这也揭示了检测器的根本限制:它学到的只是特定模式,新模型可能有意或无意绕开它,人写的文字也可能被误判。作者因此把项目定位为理解检测系统与验证器应用的教学实验,而非可靠的身份裁决工具。