一份文件加上一個問題,比起快速瀏覽整個產品,更能展示出更有用的私人 AI 示範。觀眾可以檢視輸入內容、追蹤模型路徑,並評估答案。我們的立場是,示範應該讓這些檢查成為可能,即使這意味著要展示某些限制。
這是一篇八月份的編輯補遺文章,於九月份進行研究並發表。文章列出了我們建議的示範標準;這並非客戶測試報告,亦不代表每個工作流程均已通過該標準。
請在答案前先說出路線名稱
該 Software Tailor 產品目錄 包括不同任務的應用程式。首先說明應用程式名稱及示範的工作。然後指出所選模型是在裝置上、本機組織伺服器上,還是透過可選的託管服務提供者運行。周圍應用程式上的標籤並未說明此特定請求是由哪種路徑處理。
在本地示範中,需區分準備階段與推理階段。模型可能需要在會議前下載。觀眾應該清楚哪些部分已完成,哪些部分是現場操作。否則,一個看似完整的示範會留下重要問題未解答。
請勿在會議中使用無關的私人資料。請使用觀眾有權查看且可納入評估記錄的文件。無需展示真實的通信內容來證明答案是否可與來源核對。
讓觀眾有東西可供檢視
選擇一個答案可在可見段落中找到的問題。模型回應後顯示該段落,並保留足夠的上下文以揭示例外情況。示範應縮短尋找證據的路徑,而非要求觀眾接受演示者的判斷。
然後加入一個文件未有回答的問題。事前商定一個令人滿意的回應標準。能對每個問題都給出合理答案的系統或許能令演示順暢,但該演示並未證明工作流程如何處理缺失的證據。
NIST 將評估描述為將可信度考量納入 AI 系統的一部分。[2] 簡短的產品示範只是該工作中的一小部分。它應以特定條件下的觀察結果呈現,而非取代買方的評估。
保持候選人身份可識別
Hugging Face 的模型卡格式支援記錄預期用途及評估資訊。[1] 請保留該來源參考與會議中使用的候選模型。請記錄模型版本及應用程式配置,而非僅保留顯示名稱的截圖。
如果演示者在不同範例之間更改了模型或設定,請說明。由不同配置組合而成的示範並非本質上無用,但觀眾需要知道每個結果屬於哪個配置。 模型選擇記錄 是保存這些詳情的理想位置。
這亦有助於在無法重現會話時進行處理。首要問題變成是否使用了相同的輸入和配置,而非某人是否正確記得原始回應。
以未解答的問題作結
一個有用的示範可以以一個簡短的未測試項目清單作結:不同的文件版面、第二種語言、同時使用者,或服務中斷後的恢復路徑。每一項目都應描述具體的下一步檢查。避免含糊地承諾更長的試點計劃會涵蓋所有內容。
我們的 升級接受文章 當軟件變更時,亦會套用相同的習慣。證據應隨決策一同保存,讓下一次示範能與上一次作比較。
從以下選擇一個職位 AI 套件 並清楚展示其輸入、路由及結果。能夠檢視限制的觀眾,比起只見過精緻答案的觀眾,更能作出明智的判斷。