档案编号 MY-0001
OpenAI AI 文本分类器
一个免费的网页工具,判断一段英文是否由 AI 写成——面向教师与编辑,上线七个月后因准确率过低被撤回。
初衷
它针对的不是检测本身,而是几类具体危害:自动化的虚假信息投放、借助 AI 的学术不诚信,以及把自己伪装成人的聊天机器人。分类器面向英语文本,输入越长越可靠;OpenAI 把它定位为给教育者参考的、不完美的信号,并在发布页上直接公布了挑战集上的评测结果。
时间线
-
2023-01-31 · date
OpenAI 发布面向英文的 AI 文本分类器,同时公布自己的评测结果:命中 26% 的 AI 文本,误标 9% 的人类文本。
-
2023-07-20 · date
发布页被修改为:分类器因准确率过低,自该日起不再可用。
-
2023-07-20 · date
同一页面上,OpenAI 表示正在研究更有效的文本溯源方法,并承诺为 AI 音频与视觉内容开发判断机制。
后来发生了什么
OpenAI 直接修改了最初的发布页,写明自 2023 年 7 月 20 日起,分类器因准确率过低而不再可用。公司没有单独发布停止公告。同一页面还说明,团队正在研究更有效的文本溯源方法,并承诺开发让用户能判断音频或视觉内容是否由 AI 生成的机制。
停止原因
准确率过低——由 OpenAI 在发布页上自己说明:在其自建挑战集上,它能识别出 26% 的 AI 生成文本,同时把 9% 的人类文本误标为 AI 生成。
策展人解读
编辑分析:这份档案里最有价值的不是「工具失败了」,而是失败在发布时就已被量化并公开。26% 的命中率对课堂上那个判断几乎没有帮助;数字公开之后,停止提供工具比继续调参更合理。这是我们的解读,OpenAI 的页面只陈述了结果。
留下了什么
OpenAI 指向的是溯源方向(例如面向生成媒体的内容凭证)。本馆把它记为后续路线,而不是替代工具。
许可:未知;复用前请核实
制作者总结
OpenAI 把停止信息写在发布页里,而不是另发公告;本条的日期精度来自那次修改,独立报道出现在五天后。
真正的信息在发布页里就已经写好了:26% 的命中率和 9% 的误报率。后来被证明这不是起点而是全部,工具随即下线。替代它的不是更准的分类器,而是绑定在生成内容上的溯源机制——那是另一种产品,失败方式也不同:如果生成系统自己记录来源,就不需要事后猜测作者是谁。
如果重新尝试
检测当初被描述为溯源成熟前的过渡方案,而溯源后来先在图像与音频上落地,文本反而没有。待解的问题是:独立存在的文本分类器,能否好到足以承担它的误报代价;还是说,纯文本的作者身份在事后本就无法可靠还原。
来源与核验
支持内容:Both ends of the story, because OpenAI edited the launch post rather than publishing a shutdown notice: the launch, the 26%/9% evaluation on OpenAI's challenge set, the 20 July 2023 withdrawal with "low rate of accuracy" as the stated reason, and the commitment to provenance research.
支持内容:Independent reporting that the tool was shut down and that the stated cause was its low rate of accuracy. Published five days after the date OpenAI records on its own page.
支持内容:The earlier openly released detector that OpenAI compares its 2023 classifier against. Recorded for the comparison; the repository's license was not verified.