AI Server tillhandahåller ett OpenAI-kompatibelt API för applikationer på infrastruktur som organisationen kontrollerar. En agentintegration kräver ett mer specifikt acceptanstest än ett lyckat chatt-svar: den valda modellen måste föreslå den avsedda operationen, och värdapplikationen måste hantera det förslaget korrekt. Vår AI Server produktsida beskriver distributionsrollen; följande procedur beskriver hur vi rekommenderar att man kontrollerar en individuell integration.

MLCommons dokumentation för edge agentic benchmark från juli 2026 illustrerar skillnaden. Dess exempel skickar verktygsdefinitioner till en Chat Completions-endpoint och inspekterar strukturerade anrop som modellen returnerar.[1] Ett endpoint-namn i sig fastställer inte att varje kombination av modell, runtime och ramverk kommer att slutföra samma arbetsflöde.

Börja med en förfrågan som inte kan ändra affärsdata

Välj en engångstestarbetsyta och en modell avsedd för uppgiften. Registrera serverversion, runtime, modellidentifierare och agentramverksversion. Inkludera den effektiva endpointen och transportinställningarna, men håll bort autentiseringsuppgifter från rapporten. Registreringen bör särskilja den testade installationen från en liknande modell eller en äldre server som fortfarande körs någon annanstans.

Börja med en vanlig textförfrågan. Bekräfta vilken endpoint som mottog den, vilken modell som hanterade den och om anroparen fick ett komplett svar. Upprepa via det ramverk som ska användas i piloten. Ett direkt HTTP-svar med framgång och ett ramverkssvar med framgång är separata observationer; behåll båda resultaten.

Använd en kort indata med ett förutsägbart svar så att anslutningsfel lätt kan särskiljas från uppgiftens svårighet. En genererad hälsning fastställer väldigt lite om ett inköpsflöde, men är en användbar första kontroll av rutten. Lägg inte till affärsautentisering bara för att göra detta initiala test mer realistiskt.

Kontrollera ett ofarligt verktygsförslag innan exekvering

Definiera en snäv testoperation, som att slå upp en artikel i ett påhittat lager. Ge den ett litet schema med obligatoriska fält och en uttrycklig uppsättning tillåtna värden. I detta skede fångar du modellens föreslagna operation utan att exekvera den. Kontrollera operationsnamnet, de tolkade argumenten och ramverkets hantering av saknade eller oväntade fält.

Håll testuppsättningen tillräckligt enkel för att en person ska kunna granska varje resultat. En modell som returnerar trovärdig prosa om en artikel har inte nödvändigtvis producerat ett användbart verktygsanrop. Omvänt kan ett välformat anrop ändå namnge fel artikel. Registrera formatacceptans och uppgiftsriktighet separat.

Om produktionsapplikationen strömmar svar, kör samma kontroll via streaming. Verifiera att konsumenten väntar tills det relevanta strukturerade värdet är komplett innan det tolkas. Behandla varje skillnad mellan strömmat och icke-strömmat hantering som ett integrationsproblem som behöver lösas, istället för att anta att den framgångsrika vägen täcker båda.

Slutför rundresan med ett kontrollerat resultat

Efter att förslaget godkänts, tillåt värden att anropa det påhittade lagret och returnera dess resultat till modellen. Inspektera det efterföljande svaret. Det bör använda det tillhandahållna resultatet och bevara den begärda artikelns identitet. Inkludera en uppslagning som inte ger någon träff så att applikationen måste representera frånvaro ärligt.

Utför sedan en kort sekvens som kräver en andra uppslagning. Verifiera hur ramverket kopplar varje resultat till dess ursprungliga anrop och hur nästa förfrågan för samtalet framåt. Spara en sanerad spårning som visar sekvensen utan att behålla riktiga kunddokument.

Detta är punkten där en enkel demonstration i ett steg blir ett arbetsflödestest. Spårningen bör avslöja en felaktig koppling, en onödig upprepning eller en övergiven uppgift. Oktober benchmark-artikel förklarar varför arbetsbelastningsgränser är viktiga vid utvärdering av dessa längre interaktioner.

Håll behörighetskontroller utanför modellens bedömning

OWASP identifierar överdriven funktionalitet, behörigheter och autonomi som orsaker till överdriven agentverksamhet. Deras vägledning placerar auktoriseringskontroller i systemen som utför åtgärder och rekommenderar mänskligt godkännande för operationer med hög påverkan.[2] För denna integration, testa dessa kontroller oberoende av om modellen vanligtvis begär rimliga åtgärder.

Utöka den fabricerade inventarie-fixturen med en operation som anroparen inte har tillåtelse att utföra. Verifiera att värden eller nedströms tjänst vägrar den även när de föreslagna argumenten ser giltiga ut. Avslaget bör förbli begripligt för användaren och bör inte få ramverket att ersätta med en mer privilegierad behörighet.

Inkludera ett hämtat testdokument som innehåller en irrelevant instruktion. OWASP beskriver indirekt promptinjektion genom externt innehåll och noterar att retrieval-augmented generation inte helt eliminerar sårbarheten.[3] Acceptanskriteriet här är konkret: hämtad prosa får inte ge applikationen ytterligare behörigheter. Detta test är en användbar kontroll, inte bevis på att varje injektionsförsök kommer att blockeras.

Avsluta med avbrott och en inspelad omfattning

Avbryt testverktyget, avbryt en förfrågan och gör en beroende tillfälligt otillgänglig. Observera vad användaren ser och vad ramverket försöker igen. Innan ett verktyg som ändrar poster introduceras, kom överens om hur en omförsökning ska undvika att duplicera en redan slutförd åtgärd. Det beslutet hör hemma i applikationsdesignen och kontraktet med nedströms tjänst.

Vår föreslagna acceptanspost listar de exakta operationer som testats, de tillåtna identiteterna och eventuellt olöst beteende. En lyckad inventarieuppslagning bör endast auktorisera den överenskomna pilotomfattningen. En ny anslutning, bredare behörighet eller annan modell bör leda till en översyn av de berörda kontrollerna.

För en diskussion om distribution, ta med den posten till en Software Tailor integrationsgranskning, tillsammans med ett redigerat felande exempel om ett sådant finns. Nästa användbara steg är en reproducerbar lucka med en ansvarig. Den operativa överlämningen bör bevara dessa ansvariga efter att det initiala integrationsarbetet avslutats.

Referenser

[1] MLCommons. Call for Submission: Edge Agentic Inference Benchmark for MLPerf Inference v6.1. Juli 2026. Åtkomst 2026-09-26.

[2] OWASP Gen AI Security Project. LLM06:2025 Överdriven agentur. Utgåva 2025. Hämtad 2026-09-26.

[3] OWASP Gen AI Security Project. LLM01:2025 Promptinjektion. Utgåva 2025. Hämtad 2026-09-26.

Relaterade artiklar

Get it from Microsoft