AI Server 為組織自主管理的基礎設施上的應用程式提供與 OpenAI 相容的 API。代理整合需要比成功的聊天回應更具體的驗收測試:所選模型必須提出預期的操作,且主機應用程式必須正確處理該提案。我們的 AI Server 產品頁面 描述了部署角色;以下程序說明我們建議如何檢查個別整合。

MLCommons 2026 年 7 月的邊緣代理基準文件說明了此區別。其範例將工具定義發送至聊天完成端點,並檢查模型返回的結構化調用。[1] 僅端點名稱無法確保每個模型、執行環境及框架組合都能完成相同工作流程。

從無法更改業務資料的請求開始

選擇一次性測試工作區及適合任務的模型。記錄伺服器版本、執行環境、模型識別碼及代理框架版本。包含有效端點及傳輸設定,但報告中不應包含憑證。記錄應區分被測安裝與同名模型或仍在其他地方運行的舊伺服器。

從一個普通文字請求開始。確認接收該請求的端點、處理該請求的模型,以及呼叫方是否收到完整回應。透過將用於試點的框架重複此步驟。直接 HTTP 成功與框架成功為獨立觀察;請保留兩者結果。

使用簡短且答案可預測的輸入,以便輕易區分連線失敗與任務難度。生成的問候語對購買工作流程幾乎無影響,但作為路由的初步檢查非常有用。切勿僅為使初測更真實而加入業務憑證。

執行前檢查無害的工具提案

定義狹窄的測試操作,例如查詢虛構庫存中的項目。給予其小型結構,包含必填欄位及明確允許值集合。此階段擷取模型提出的操作,且不執行。檢查操作名稱、解析後的參數及框架對缺失或意外欄位的處理。

保持測試裝置簡單,讓人員能檢視每個結果。模型返回關於項目的合理文字不代表已產生可用的工具調用。反之,格式良好的調用仍可能命名錯誤項目。分別記錄格式接受度與任務正確性。

若生產應用程式使用串流回應,請透過串流執行相同檢查。確認消費端在解讀前會等待相關結構化值完整。將串流與非串流處理差異視為需解決的整合問題,勿假設成功路徑涵蓋兩者。

以受控結果完成整個循環

提案通過驗證後,允許主機呼叫虛構庫存並將結果返回模型。檢查後續回答,應使用所提供結果並保留請求項目身份。包含一個無匹配結果的查詢,讓應用程式必須誠實表示缺失。

然後執行一段需要第二次查詢的短序列。驗證框架如何將每個結果與其原始調用關聯,以及下一個請求如何推動對話進展。保存一份已清理的追蹤記錄,展示該序列而不保留真實客戶文件。

這是單回合示範轉變為工作流程測試的關鍵點。追蹤記錄應揭示錯誤關聯、不必要的重複或被放棄的任務。 十月基準文章 解釋了在評估這些較長互動時,工作負載邊界為何重要。

將權限檢查置於模型判斷之外

OWASP 指出過度功能、權限及自主性是過度代理的成因。其指引建議將授權檢查置於執行操作的系統中,並建議對高影響操作進行人工審批。[2] 對於此整合,應獨立測試這些控制,無論模型通常是否會對合理操作提出請求。

擴展虛構的庫存測試裝置,加入一項呼叫者無權執行的操作。驗證主機或下游服務即使在提出的參數看似有效時仍拒絕該操作。拒絕原因應對用戶保持可理解,且不應導致框架替換為更高權限的憑證。

包含一份檢索到的測試文件,其中含有無關指令。OWASP 描述了透過外部內容的間接提示注入,並指出檢索增強生成並未完全消除此漏洞。[3] 此處的接受標準具體明確:檢索到的文本不得賦予應用程式額外權限。此測試為有用檢查,非證明所有注入嘗試均會被阻擋。

以中斷和記錄範圍作結

中斷測試工具,取消請求並使依賴項暫時不可用。觀察用戶所見及框架的重試行為。在引入會更改記錄的工具前,需達成共識,確保重試不會重複已完成的操作。該決策應納入應用設計及下游服務合約。

我們建議的接受記錄列出測試的精確操作、允許的身份及任何未解決的行為。成功的庫存查詢應僅授權約定的試點範圍。新增連接器、更廣泛權限或不同模型應促使檢查項目重新審視。

在部署討論時,攜帶該記錄至 Software Tailor 整合審查,如有失敗範例,請附上已編輯版本。下一步有用的行動是擁有負責人的可重現缺口。 運營交接 應在初始整合工作結束後保留這些負責人。

參考文獻

[1] MLCommons。 徵稿啟事:MLPerf 推理 v6.1 邊緣代理推理基準。2026 年 7 月。存取日期 2026-09-26。

[2] OWASP 生成式 AI 安全計劃。 LLM06:2025 過度代理權限。2025 年版。存取日期 2026-09-26。

[3] OWASP 生成式 AI 安全計劃。 LLM01:2025 提示注入。2025 年版。存取日期 2026-09-26。

相關文章

Get it from Microsoft