一份文档和一个问题,比快速浏览整个产品更能展示有价值的私有 AI 演示。观众可以检查输入,跟踪模型路径,并评判答案。我们的立场是,演示应当使这些检查成为可能,即使这意味着展示某些局限性。
这是八月份的编辑补充文章,于九月份调研并发布。本文阐述了我们推荐的演示标准;这不是客户测试报告,也不意味着每个工作流程都已通过该标准。
请在答案前说明路径
该 Software Tailor 产品目录 包含针对不同任务的应用程序。首先说明应用程序名称及所演示的工作内容。然后指出所选模型是在设备上、本组织服务器上运行,还是通过可选的托管服务提供商运行。应用程序周围的标签并未说明此次请求是通过哪种方式处理的。
对于本地演示,要区分准备阶段和推理阶段。模型可能需要在会话开始前下载。观众应了解哪些部分已经完成,哪些部分正在实时演示。否则,一个看似自包含的演示会留下重要问题未解答。
请勿在会话中使用无关的私人资料。请使用观众有权查看且可纳入评估记录的文档。无需暴露真实通信内容即可演示答案是否可与来源核对。
给观众提供可检查的内容
选择一个其答案可以在可见段落中找到的问题。模型回答后显示该段落,并保留足够的上下文以揭示例外情况。演示应缩短获取证据的路径,而不是要求观众接受演示者的判断。
然后提出一个文档未能回答的问题。事先达成一致,确定令人满意的回答应是什么样子。一个对每个问题都能给出合理答案的系统可能会使演示顺畅,但这种演示并不能证明工作流程如何处理缺失的证据。
NIST 将评估描述为将可信性考虑纳入 AI 系统的一部分。[2] 简短的产品演示只是这项工作的一个小环节。它应作为在特定条件下的观察呈现,而非买方评估的替代。
保持候选人身份可识别
Hugging Face 的模型卡格式支持记录预期用途和评估信息。[1] 请保留该来源引用与会话中使用的候选模型。应记录模型版本和应用配置,而不仅仅是显示名称的截图。
如果演示者在示例之间更改了模型或设置,请说明。由不同配置组合而成的演示并非本质上无用,但观众需要知道哪个结果对应哪个配置。 模型选择记录 是存放这些详细信息的自然位置。
这也有助于在无法重现会话时进行排查。首要问题变成了是否使用了相同的输入和配置,而不是某人是否正确记得了原始响应。
以未解答的问题作为结尾
一次有益的演示可以以一份简短的未测试项清单结束:不同的文档布局、第二种语言、同时用户数量,或服务中断后的恢复路径。每一项都应描述一个具体的后续检查。避免含糊地承诺更长时间的试点将涵盖所有内容。
我们的 升级验收文章 当软件发生变化时,也应保持相同的习惯。证据应随决策一起传递,以便下一次演示可以与上一次进行比较。
从中选择一个职位 AI 套件 并清晰展示其输入、路径和结果。能够检查限制的观众比只看到精心制作答案的观众更有能力做出判断。