要闻列表OpenAI 终于解释了为什么 ChatGPT 会喋喋不休地谈论 Goblins
Decrypt2026-04-30 17:16:37

OpenAI 终于解释了为什么 ChatGPT 会喋喋不休地谈论 Goblins

ORIGINALOpenAI Finally Explains Why ChatGPT Wouldn't Stop Talking About Goblins
AI 影响分析Grok 分析中...
📄完整原文· 由 trafilatura 自动抓取Gemini 翻譯6176 字
简要概述 - OpenAI 的"Nerdy"人格奖励了哥布林隐喻,通过强化学习将这一怪癖扩散到了所有 GPT 模型中。 - GPT-5.4 的 Nerdy 模式中哥布林相关提及相较 GPT-5.2 激增 3,881%,引发了内部调查和紧急系统提示词补丁。 - 修复方法——在开发者提示词中写入"never talk about goblins"——表明了为何系统提示词补丁比重新训练更快,但风险也更大。 如果你最近请 ChatGPT 帮忙写代码,而它回应时把你的 bug 称为"调皮的小 gremlin",你不是在幻觉。该模型对奇幻生物产生了真正的痴迷——goblins、gremlins、raccoons、trolls、ogres,是的,还有 pigeons——OpenAI 发布了一份完整的事后分析报告,说明这一切是如何发生的。 简短版本是:一个旨在让 ChatGPT 更俏皮的奖励信号失控了,于是哥布林们繁殖开来。 哥布林事件之所以曝光,是因为 Reddit 用户在 GitHub 上泄露的 Codex 系统提示词中发现了"never mention goblins"这一行。 该帖子在 OpenAI 发布自己的说明之前就已经走红。 Nerdy 人格如何催生了哥布林的泛滥 据 OpenAI 称,事情的起点是去年 11 月推出的 GPT-5.1。当时 OpenAI 引入了人格自定义功能,允许用户选择诸如 Friendly、Professional、Efficient 和 Nerdy 等风格。Nerdy 人格附带了一个系统提示词,告诉模型要书呆子气且俏皮,要"通过俏皮的语言运用来打破装腔作势",并承认"世界是复杂而奇异的"。 事实证明,那个提示词就是一块哥布林磁铁。 在强化学习训练过程中,Nerdy 人格的奖励信号一贯地对包含生物词隐喻的输出打出更高的分数。在审计的数据集中,有 76.2% 的情况下,含有"goblin"或"gremlin"的回复比不含这些词的相同回复得分更高。模型由此学到:奇思妙想等于奖励。 哥布林的提及在 GPT-5.4 中爆炸式增长,Nerdy 人格相较 GPT-5.2 出现了 3,881% 的增长。 问题在于,强化学习并不能将习得的行为整齐地隔离开来。一旦某种风格癖好在某个情境中获得奖励,它就会通过反馈循环渗透到其他情境中:模型生成充斥生物词的输出,这些输出又被重新用于微调数据,于是这种行为在整个模型中加深,即使没有激活 Nerdy 提示词也是如此。 Nerdy 仅占所有 ChatGPT 回复的 2.5%,却贡献了所有"goblin"提及的 66.7%。由于 OpenAI 的训练方法,当 Nerdy 人格处于激活状态时,goblin 和 gremlin 的出现率随着训练进度稳步攀升。 即使没有 Nerdy 人格,生物词的提及也在悄然上升——这是通过监督微调数据发生交叉污染的证据。 GPT-5.5 已经无可挽回 当 OpenAI 找到根本原因时,GPT-5.5 已经深入训练阶段,并且已经吸收了一整套生物词家族。一次数据审计标记出的不仅是 goblins 和 gremlins,还包括 raccoons、trolls、ogres 和 pigeons,公司称之为"癖好词"。(顺便说一句,"Frogs"大多是合法使用。) 首次可测量的激增:在 GPT-5.1 发布后,goblin 提及上升了 175%,gremlin 提及上升了 52%。 就连 OpenAI 首席科学家 Jakub Pachocki 在请求生成一只 ASCII 艺术独角兽时,也得到了一只哥布林。 OpenAI 于 3 月停用了 Nerdy 人格,并从未来的训练中清除了与生物词相关的奖励信号。但 GPT-5.5 当时已经开始了训练运行。该公司针对 Codex(其编程代理)的解决方案是简单地在开发者系统提示词中加上一行:"Never talk about goblins, gremlins, raccoons, trolls, ogres, pigeons, or other animals or creatures unless it is absolutely and unambiguously relevant to the user's query." OpenAI 的某个人把这行字提交到了生产代码中,然后继续过着他的日子。 系统提示词补丁的问题 但 OpenAI 为何选择这条路径? 重新训练一个 GPT-5.5 规模的模型来去除某个行为怪癖既昂贵又缓慢。而调整一下系统提示词只需几分钟。整个行业的公司在用户投诉激增时都会首先伸手去拿提示词补丁,因为它是低成本、快速部署的选项。 但提示词补丁也有自身的风险。它们并不修复底层行为,只是压制它。而压制可能会有副作用。 OpenAI 的哥布林事件是一个相对温和的例子。这种动态最骇人的版本是去年发生在 Grok 上的事件。xAI 推送了一个系统提示词更新,告诉 Grok 把媒体视为有偏见,并"不要回避政治不正确的主张",结果该聊天机器人在 16 小时内自称"MechaHitler",并在 X 上发布反犹太内容。修复方法是又一次提示词更改,但矫枉过正得太厉害,以至于 Grok 开始在小狗图片、云朵甚至自己的 logo 中标记反犹太主义。绝望的提示词工程层层升级,演变成更加绝望的提示词工程。 哥布林补丁还没造成那么戏剧化的后果。但 OpenAI 承认,GPT-5.5 发布时底层的怪癖仍然完好无损,只是在 Codex 中被压制了。该公司甚至发布了一条命令,用户如果想让生物们回来,可以用它来移除哥布林抑制指令。 为什么公司隐藏自己的系统提示词 在 AI 行业中,隐藏或混淆完整的系统提示词很常见。各公司将系统提示词视为商业机密,原因有几点:知识产权保护、竞争优势和安全性。如果越狱者知道模型遵循的确切规则,绕过它们就变得轻而易举。 还有一个公司不会公开宣传的第四个原因:形象管理。一行"never mention goblins"无法让人对底层技术产生信心。公开它需要幽默感或强大的研究文化,或者两者兼备。 OpenAI 表示,此次调查催生了新的内部工具,用于审计模型行为并将行为怪癖追溯到其训练根源。GPT-5.5 的训练数据此后已被清除生物词相关示例。下一代模型应该会"无哥布林"地到来——当然,除非有别的什么东西因为目前无人理解的原因而获得奖励。
数据状态✓ 已抓取全文阅读原文(Decrypt)
🔍历史类似事件· 关键词 + 标的比对6 则
💡 目前用关键词 + 标的比对(MVP)· 之后会升级为 embedding 语义搜寻
原始信息
ID:3dbe7027a0
来源:Decrypt
发布:2026-04-30 17:16:37
分类:一般 · 导出分类 neutral
标的:未指定
社群投票:+0 /0 · ⭐ 0 重要 · 💬 0 留言