AI Server biedt een OpenAI-compatibele API voor applicaties op infrastructuur die de organisatie beheert. Een agentintegratie vereist een specifiekere acceptatietest dan een succesvolle chatrespons: het gekozen model moet de beoogde operatie voorstellen, en de hostapplicatie moet dat voorstel correct afhandelen. Onze AI Server productpagina beschrijft de implementatierol; de volgende procedure beschrijft hoe wij aanbevelen een individuele integratie te controleren.

De documentatie van MLCommons' edge agentic benchmark van juli 2026 illustreert het onderscheid. De voorbeelden sturen tooldefinities naar een Chat Completions-eindpunt en inspecteren gestructureerde aanroepen die door het model worden teruggegeven.[1] Alleen een eindpuntnaam bewijst niet dat elke combinatie van model, runtime en framework dezelfde workflow zal voltooien.

Begin met een verzoek dat geen bedrijfsgegevens kan wijzigen

Kies een wegwerp testwerkruimte en een model dat voor de taak bedoeld is. Noteer de serverbuild, runtime, modelidentificatie en agentframeworkversie. Neem de effectieve eindpunt- en transportinstellingen op, maar houd inloggegevens buiten het rapport. De registratie moet de geteste installatie onderscheiden van een gelijknamig model of een oudere server die elders nog draait.

Begin met één gewone tekstaanvraag. Bevestig welk eindpunt deze ontving, welk model het afhandelde en of de aanroeper een volledige respons ontving. Herhaal dit via het framework dat in de pilot zal worden gebruikt. Een directe HTTP-succes en een framework-succes zijn aparte observaties; bewaar beide resultaten.

Gebruik een korte invoer met een voorspelbaar antwoord zodat verbindingsfouten gemakkelijk te onderscheiden zijn van taakmoeilijkheid. Een gegenereerde begroeting zegt weinig over een aankoopworkflow, maar is een nuttige eerste controle van de route. Voeg geen zakelijke inloggegevens toe alleen om deze initiële test realistischer te maken.

Controleer een onschuldig toolvoorstel vóór uitvoering

Definieer een beperkte testoperatie, zoals het opzoeken van een item in een gefingeerde inventaris. Geef het een klein schema met verplichte velden en een expliciete set toegestane waarden. Leg in dit stadium het door het model voorgestelde operatievoorstel vast zonder het uit te voeren. Controleer de operatienaam, de geparseerde argumenten en de behandeling door het framework van ontbrekende of onverwachte velden.

Houd de testopstelling eenvoudig genoeg zodat een persoon elk resultaat kan inspecteren. Een model dat plausibele tekst over een item teruggeeft, heeft niet per se een bruikbare toolaanroep geproduceerd. Omgekeerd kan een goed gevormde aanroep toch het verkeerde item noemen. Registreer acceptatie van het formaat en correctheid van de taak apart.

Als de productieapplicatie antwoorden streamt, voer dan dezelfde controle uit via streaming. Verifieer dat de consument wacht tot de relevante gestructureerde waarde compleet is voordat deze wordt geïnterpreteerd. Behandel elk verschil tussen gestreamde en niet-gestreamde verwerking als een integratiebevinding die opgelost moet worden, in plaats van aan te nemen dat het succesvolle pad beide dekt.

Rond de cyclus af met een gecontroleerd resultaat

Nadat het voorstel is gevalideerd, laat de host de gefingeerde inventaris aanroepen en het resultaat aan het model teruggeven. Inspecteer het daaropvolgende antwoord. Dit moet het geleverde resultaat gebruiken en de gevraagde itemidentiteit behouden. Neem een zoekopdracht op die geen overeenkomst oplevert zodat de applicatie afwezigheid eerlijk moet weergeven.

Voer vervolgens een korte reeks uit die een tweede opvraging vereist. Controleer hoe het framework elk resultaat koppelt aan de oorspronkelijke oproep en hoe het volgende verzoek het gesprek voortzet. Sla een gesaniteerde trace op die de reeks toont zonder echte klantdocumenten te bewaren.

Dit is het punt waarop een demonstratie met één beurt verandert in een workflowtest. De trace moet een verkeerde koppeling, een onnodige herhaling of een afgebroken taak blootleggen. Het benchmarkartikel van oktober legt uit waarom grenzen in de werklast belangrijk zijn bij het evalueren van deze langere interacties.

Houd permissiecontroles buiten het oordeel van het model

OWASP identificeert overmatige functionaliteit, permissies en autonomie als oorzaken van overmatige agentie. De richtlijnen plaatsen autorisatiecontroles in de systemen die acties uitvoeren en bevelen menselijke goedkeuring aan voor operaties met grote impact.[2] Voor deze integratie test u die controles onafhankelijk van of het model gewoonlijk om zinvolle acties vraagt.

Breid de gefabriceerde inventarisfixture uit met een bewerking die de aanroeper niet mag uitvoeren. Controleer dat de host of downstreamservice deze weigert, zelfs als de voorgestelde argumenten geldig lijken. De weigering moet begrijpelijk blijven voor de gebruiker en mag er niet toe leiden dat het framework een meer geprivilegieerde referentie vervangt.

Neem een opgehaald testdocument op met een irrelevante instructie. OWASP beschrijft indirecte promptinjectie via externe inhoud en merkt op dat retrieval-augmented generation de kwetsbaarheid niet volledig wegneemt.[3] Het acceptatiecriterium hier is concreet: opgehaalde proza mag de applicatie geen extra permissies verlenen. Deze test is een nuttige controle, geen bewijs dat elke injectiepoging wordt geblokkeerd.

Sluit af met onderbreking en een opgenomen scope

Onderbreek het testhulpmiddel, annuleer een verzoek en maak een afhankelijkheid tijdelijk onbeschikbaar. Observeer wat de gebruiker ziet en wat het framework opnieuw probeert. Voordat u een hulpmiddel introduceert dat records wijzigt, stem af hoe een herhaling voorkomt dat een reeds voltooide actie wordt gedupliceerd. Die beslissing hoort thuis in het applicatieontwerp en het contract van de downstreamservice.

Ons voorgesteld acceptatieregister vermeldt de exacte geteste bewerkingen, de toegestane identiteiten en onopgeloste gedragingen. Een succesvolle inventarisopvraging mag alleen de afgesproken pilot-scope autoriseren. Een nieuwe connector, bredere permissie of ander model moet een herziening van de getroffen controles uitlokken.

Breng voor een implementatiediscussie dat register mee naar een Software Tailor integratiereview, samen met een geredigeerd voorbeeld van een mislukking indien aanwezig. De nuttige volgende stap is een reproduceerbare lacune met een eigenaar. De operationele overdracht moet die eigenaren behouden nadat het initiële integratiewerk is afgerond.

Referenties

[1] MLCommons. Oproep tot inzending: Edge Agentic Inference Benchmark voor MLPerf Inference v6.1. Juli 2026. Geraadpleegd op 2026-09-26.

[2] OWASP Gen AI Security Project. LLM06:2025 Overmatige autonomie. Editie 2025. Geraadpleegd op 2026-09-26.

[3] OWASP Gen AI Security Project. LLM01:2025 Promptinjectie. Editie 2025. Geraadpleegd op 2026-09-26.

Gerelateerde artikelen

Get it from Microsoft