以下是那种会让团队彻夜难眠的句子:
“在这个净度等级下,你用肉眼什么都看不到。”
这是我们的助手在解释一颗钻石时生成的。它引用的等级是真实的——SI1,印在
该钻石的实验室报告上。但随之而来的承诺却是虚构的。净度等级是在
10倍放大镜下评定的;它并不能决定肉眼会看到什么。两颗SI1等级的钻石看起来可能完全
不同——一颗在一臂距离外看起来很干净,另一颗则在正中间有一个可见的斑点。
该模型基于一个真实的事实制造了其后果,因为那样听起来像是一句有用的
话。
请注意这句话不是什么。它不是一个被禁用的词。它不是一颗幻构出来的钻石。它
不包含错误的数字。它没有违反任何你可以预先写下的规则。它只是流畅——而流畅正是问题所在。流畅和真实是不同的变量,而语言模型优化的是前者。
我们构建人工智能助手正是为了应对这类产品。本文中的助手用于解释钻石:
一段关于单颗钻石的简短双人对话——主持人提出购物者会问的问题,宝石学家作答——所有内容均基于该钻石的证据生成。钻石是高考量购买的典型定义:价值数千美元,购买频率低,且在不确定性中做出选择。而且它具有一个特性,使其成为生成式人工智能严酷的测试平台——几乎每一项关于钻石的说法都可以与其来自美国宝石学院(GIA)或国际宝石学院(IGI)的证书进行核对,这两家是评定全球钻石等级的独立实验室。在此情境下,夸大宣传不仅显得俗气,而且是可以被核查的。
在一篇早期的文章中,我们主张语言模型应负责引导对话,而由一个确定性的核心模块做出所有决策。本文是将同样的世界观应用于质量管控。模型负责撰写,但无权评定等级。
在单次生成中,你可以通过阅读捕捉到像上面那样的句子。但在整个钻石目录中,你无法做到这一点。因此,在优化写作模型之前,我们构建了一个工具:一个独立的大型语言模型评判器,它根据证据阅读每一条生成的声明,并返回一个可量化的裁决结果。本文旨在介绍该评判器的构建方式、我们如何确保评判器本身的诚实性,以及拥有它之后发生的变化——即争论停止了。
第一部分——三道关卡,以及谁拥有哪条规则
助手每次解释一颗钻石,依据的是该钻石的证据:实验室证书、
价格、零售商发布的钻石分析报告。一条规则统领全局:关于这颗钻石的每一项
声明都必须追溯到提供的证据。如果证据无法回答——它是否肉眼无瑕,即肉眼看不到任何瑕疵?——助手会明确说明:诚实的回答是“可能”,并且不会做出更多承诺。然后,它会引导购物者咨询人类宝石学家。
执行这条规则并非依靠单一机制。而是三层机制,且性质各异。
第一道关卡负责预防。它在代码内部、流水线中运行。当助手生成关于某颗钻石的后续问题时,该问题必须指明其答案所依据的证据路径。没有指明可用路径的问题会被拒绝——这是由代码执行的,而非依赖提示词的期望。这阻止了系统针对那些数据中没有可比集合的钻石询问“这个价格与市场相比如何?”之类的问题。模型从未有机会即兴编造答案,因为这个问题根本无法通过。
第二
免责声明:本文内容来自互联网,该文观点不代表本站观点。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容,请到页面底部单击反馈,一经查实,本站将立刻删除。