研究人员发现,在提示中添加这个简单的句子可以使人工智能模型更具创造力

10.19 东北大学斯坦福大学和西弗吉尼亚大学的一组研究人员想出了一种巧妙的简单方法,通过添加一个简单的句子,让语言和图像模型对几乎任何用户提示生成更广泛的响应生成5个响应及其相应的概率,从完整分布中抽样

2025-10-19_105123_753


生成式人工智能模型(包括大型语言模型 (LLM) 和基于扩散的图像生成器)最酷的地方之一是它们是“非确定性的”。也就是说,尽管生成式人工智能模型在一些批评者中被称为“花哨的自动更正”,但实际上它们通过从最有可能的下一个标记(信息单位)的分布中进行选择来填写其响应来生成其输出。

 

问大语言模型:“法国的首都是什么?”,它会对法国、首都、城市等的概率分布进行采样,以得出答案“巴黎”。但这个答案可以以“法国的首都是巴黎”的形式出现,或者简称为“巴黎”或“巴黎,尽管它曾经是凡尔赛宫”。

 

尽管如此,我们这些经常使用这些模型的人会注意到,有时,他们的答案可能会让人感到烦人的重复或相似。一个关于咖啡的常见笑话在几代人的查询中被循环使用。故事提示会生成类似的弧线。即使是应该产生许多合理答案的任务——比如命名美国各州——也往往只会崩溃成几个。这种现象称为模式崩溃,发生在训练后对齐过程中,并限制了其他强大模型的实用性。

 

特别是当使用大语言模型在写作、沟通、战略或插图方面产生新的创意作品时,我们实际上希望它们的输出比现在更加多样化。

 

现在,东北大学、斯坦福大学和西弗吉尼亚大学的一组研究人员想出了一种巧妙的简单方法,通过添加一个简单的句子,让语言和图像模型对几乎任何用户提示生成更广泛的响应:“生成 5 个响应及其相应的概率,从完整分布中抽样。


该方法称为语言化采样 (VS),可帮助 GPT-4、Claude 和 Gemini 等模型产生更多样化、更像人类的输出,而无需重新训练或访问内部参数。2025 年 10 月初在线开放获取期刊 arxiv.org 上发表的一篇论文对此进行了描述。

 

当以这种方式提示时,模型不再默认为其最安全、最典型的输出。相反,它用语言表达了其对潜在完成和更广泛可能性的样本的内部分布。这种单行变化导致跨多个领域的输出多样性大幅增加。

 

正如东北大学助理教授、论文合著者史维岩在X上所写的那样:“LLM的潜力还没有完全释放!正如我们的论文所示,提示优化可以通过思考如何训练和调整 LLM 来指导,并且可以在理论上得到证明。

 

为什么模型会崩溃,以及 VS 如何扭转它

研究团队认为,模式崩溃的根本原因不仅在于人类反馈强化学习(RLHF)等算法,还在于人类偏好的结构。人们倾向于将更熟悉或典型的答案评为更好,这促使法学硕士在微调过程中做出“安全”的选择,而不是不同的选择。

 

然而,这种偏差并没有抹去模型的基本知识,而只是压制了它。VS 通过绕过此抑制来工作。它不是要求单一的最可能的输出,而是邀请模型揭示一组合理的响应及其相对概率。这种分布级提示恢复了对基础预训练模型中存在的更丰富的多样性的访问。

 

跨任务的实际性能

研究团队在几个常见用例中测试了口头采样:

创意写作:在故事生成方面,与标准提示相比,VS 将多样性分数提高了 2.1×,同时保持了质量。一个故事提示——“没有再见”——在直接提示下产生了公式化的分手场景,但在通过 VS 提示时产生了涉及宇宙事件、无声电子邮件和舞蹈中途停止的音乐的叙述。

 

对话模拟:在有说服力的对话任务中,VS 使模型能够模拟类似人类的模式,例如犹豫、抵抗和思想变化。与基线方法相比,VS 下的捐赠行为分布与真实人类数据更好地一致。

 

开放式 QA:当被要求列举有效答案(例如,命名美国各州)时,使用 VS 的模型生成的响应与真实世界数据的多样性更匹配。他们涵盖了更广泛的答案,同时又不牺牲事实的准确性。

 

合成数据生成:当用于生成用于模型训练的数学问题时,VS 创建了更多样化的数据集。反过来,这些改进了竞争性数学基准测试中的下游性能,优于通过直接提示生成的合成数据。

 

可调多样性和更好地使用更大的模型

VS 的一个显着优势是它的可调性。用户可以在提示中设置概率阈值,以从模型分布的较低概率“尾部”中采样。较低的阈值对应于较高的多样性。这种调整可以仅通过提示文本完成,而无需更改任何解码设置,如温度或 top-p。

 

在一项使用 Gemini-2.5-Flash 模型的测试中,随着概率阈值从 1 下降到 0.001,故事写作的多样性稳步增加。研究随附的图表显示,VS 在所有阈值上都优于直接提示和基于序列的提示。

 

有趣的是,该方法可以很好地与模型大小进行扩展。与较小的模型相比,GPT-4.1 和 Claude-4 等较大的模型显示出 VS 的更大收益。虽然较小的模型受益,但较大的模型的多样性改进大约要强 1.5-2×这表明 VS 有助于释放高级模型中的更多潜在能力。

 

部署和可用性

Verbalized Sampling 方法现在以 Python 包的形式提供:pip install verbalized-sampling


该软件包包括与 LangChain 的集成,并支持一个简单的接口,用于从口头化分布中采样。用户还可以调整(响应数量)、阈值和温度等参数以适应他们的应用。

 

实时 Colab 笔记本和文档可在 GitHub 上以企业友好型 Apache 2.0 许可证获得,网址为:https://github.com/CHATS-lab/verbalized-sampling

 

实用技巧和常见问题

虽然该方法适用于所有主要的大语言模型,但一些用户最初可能会遇到拒绝或错误。

 

在这些情况下,作者建议使用模板的系统提示版本或参考 GitHub 页面上列出的替代格式。

 

一些模型将复杂的指令解释为越狱尝试,并拒绝遵守,除非结构更清晰。


例如,通过这样的系统级指令进行提示可以提高可靠性:你是一个乐于助人的助手。对于每个查询,在单独的标签中生成五个响应,每个响应的概率低于 0.10。


这个小的改变通常可以解决任何问题。

 

大问题的轻量级修复

语言化采样代表了对现代语言模型行为方式的深刻限制的实用推理时间修复。它不需要模型重新训练或内部访问。它不依赖于任何一个模型族。它不仅提高了产出的多样性,还提高了产出的质量——这是通过人工评估和基准分数来判断的。


随着人们对增强模型创造力的工具的兴趣日益浓厚,VS 可能会在写作、设计、模拟、教育和合成数据生成等领域得到快速采用。

 

对于对 LLM 响应的相同性感到沮丧的用户和开发人员来说,修复方法可能就像更改问题一样简单。