Kort antwoord: ServiceNow CoreAI's AutoSynthData zet agentfouten en successen van trainers om in gevalideerde synthetische SFT-taken wanneer bedrijven behoefte hebben aan omgevingscompetentie, en niet alleen aan algemene benchmarkscores. Het zuivert lacunes in capaciteitsspecificatiekaarten, vermenigvuldigt verifieerbaar werk en controleert vervolgens de kwaliteit voordat het wordt verfijnd. De door de auteur gerapporteerde EnterpriseOps Gym-functie werkt als de kracht van de trainer, de kwaliteit van de verificator en de omgevingsgetrouwheid op elkaar zijn afgestemd.
Belangrijkste conclusies:
Capability cards: Foutmeldingen worden opgeslagen in kaarten, zodat generatoren de originele ID's nooit te zien krijgen.
Controleerbaarheid van de verificator: Geef de voorkeur aan SQL-eindstatuscontroles die gemuteerde, onjuiste uitkomsten afwijzen.
Moeilijkheidsgraad: Train alleen taken die de leerling zelden oplost en die de docent doorgaans goedkeurt.
Menselijke toetsing: Handhaaf menselijke toetsing bij beleidsmaatregelen met grote gevolgen en onomkeerbare acties voordat omscholing plaatsvindt.
Grensverschuiving: Na SFT, heroverweeg en verschuif de doelfase naar de resterende hiaten.
AI-agenten in bedrijfsomgevingen falen zelden omdat ze geen algemene kennis hebben. Ze falen omdat de omgeving specifiek is: ticketbeleid, schema-eigenaardigheden, toolcontracten, vooraf ingestelde databases, kennisartikelen en workflows tussen systemen die er niet uitzien als standaardvoorbeelden. Een model dat goed scoort op open benchmarks kan nog steeds vastlopen wanneer de volgende stap rekening moet houden met een wijzigingsvenster, een CMDB-relatie of een verificator die de eindstatus controleert in plaats van een vloeiende chat.
ServiceNow CoreAI / ServiceNow-AI publiceerde AutoSynthData om die lacune direct aan te pakken. De auteur, Esakkivel Esakkiraja, beschrijft een pipeline die de mislukkingen van een doelagent – samen met de successen van een sterkere leeragent – omzet in gevalideerde synthetische trainingstaken die zijn afgestemd op bedrijfsomgevingen. Het doel is niet om meer chatlogs te verzamelen, maar om hard, verifieerbaar werk te vermenigvuldigen dat dezelfde vaardigheid onder nieuwe omstandigheden test, zodat gecontroleerde fine-tuning omgevingsspecifieke tekortkomingen kan dichten.
Dit artikel beschrijft het kernidee, de taakabstractie, de generatie- en kwaliteitscontrolecyclus, de gedeelde architectuur en de door de auteur gerapporteerde resultaten van EnterpriseOps Gym in hybride en ITSM-omgevingen. Het blijft bij wat het onderzoek beschrijft: een dynamisch leerplan van synthetische taken, en niet de bewering dat een bedrijf plotseling volledig is opgelost.
Waarom competentie op het gebied van milieu belangrijker is dan brede competenties
Bedrijven hebben agents nodig die werken binnen hun eigen omgeving – hun systemen, regels en datastatus. Brede functionaliteit is niet hetzelfde als competentie binnen die omgeving. Een agent kan weliswaar weten hoe IT-servicemanagement doorgaans werkt, maar toch de lokale beleidsregels missen die bepaalde overgangen verbieden, of de tool die een gerelateerde tabel alleen bijwerkt nadat een vereiste record aanwezig is.
Individuele mislukkingen zijn informatief, maar vormen slechts beperkte trainingsdata. Eén afgebroken traject toont een zwakte aan; het levert niet de tientallen vergelijkbare situaties op die het model zouden leren herstellen bij variaties. Teams hebben veel nieuwe taken nodig die dezelfde vaardigheid op een andere manier testen, die binnen de omgeving uitvoerbaar blijven, realistisch aanvoelen zoals de gebruiker dat vraagt, en die controleerbaar blijven aan de hand van uitkomstcontroles.
Dat is de ontwerpdwang achter AutoSynthData. Fouten worden signalen voor competentiekaarten. Kaarten genereren nieuwe taken. Een betere docent demonstreert succesvolle leertrajecten. Filters en verificatoren bepalen wat er in de set voor begeleide finetuning terechtkomt. Na de training verschuift de evaluatie de grens naar de resterende hiaten. De cyclus is curriculum-gebaseerd in plaats van een eenmalige datadump.
Voor professionals is de juiste framing belangrijk. Als je alleen mislukte prompts opslaat, loop je het risico dat je te veel focust op die specifieke entiteiten en formuleringen. Als je alleen onbeperkte, synthetische prompts genereert, loop je het risico dat taken onmogelijk, onrealistisch of onverifieerbaar zijn. AutoSynthData bevindt zich tussen deze uitersten: het zuivert wat mislukt is tot een functionaliteitsspecificatie en genereert vervolgens taken die de kern behouden, terwijl de uiterlijke vorm en beheersbare dimensies worden aangepast.
De praktische taakstructuur: systeem, prompt, verificator
Een bruikbare abstractie voor agentisch werk is: taak is gelijk aan systeemspecificatie, gebruikersprompt en verificator. Elk onderdeel bevat beperkingen die ervoor zorgen dat synthetische data gefundeerd en betrouwbaar blijven.
De systeemspecificatie omvat beperkingen, beleid en de begintoestand – bijvoorbeeld database-seeds en kennisartikelen. Het moet compatibel blijven met de beschikbare tools en de huidige status. Willekeurige moeilijkheidsbeperkingen die geen rekening houden met toolcontracten of de realiteit van de seed, leiden vaak tot instabiele taken die de verkeerde les leren.
De kwaliteit van een gebruikersprompt wordt vanuit drie invalshoeken beoordeeld. Haalbaarheid vraagt of er een geldig traject bestaat. Realisme vraagt of een gebruiker dit daadwerkelijk zou vragen. Moeilijkheidsgraad vraagt of de taak een huidige zwakte van de agent blootlegt in plaats van iets wat het doelwit al betrouwbaar oplost. Een prompt die triviaal is voor het doelwit verspilt trainingsbudget; een prompt die onmogelijk is, ondermijnt het vertrouwen van de evaluatie.
De kwaliteit van een verificator hangt af van consistentie, degelijkheid en volledigheid. Te lakse en zwakke trajecten worden goedgekeurd. Te restrictieve trajecten, waarbij slechts één traject wordt geaccepteerd en geldige alternatieve oplossingen ontbreken, worden afgekeurd. In bedrijfsomgevingen wordt vaak de voorkeur gegeven aan SQL-gebaseerde of op status gebaseerde uitkomstcontroles, omdat deze de situatie beoordelen nadat de agent heeft gehandeld, en niet het exacte pad dat de agent heeft afgelegd.
AutoSynthData is gebaseerd op deze drie pijlers, waardoor gegenereerd werk concreet blijft. Generatoren verzinnen geen losstaande quizzen. Ze produceren taken die kunnen worden uitgevoerd in de omgevingsadapter en beoordeeld door verificatoren die rekening houden met de vereiste eindtoestandseigenschappen.
Van diagnostische evaluatie tot capaciteitsspecificatiekaarten
Het proces begint met een diagnostische evaluatie van de doelagent en een sterkere leraar binnen de omgeving. Parallelle tests laten zien waar de doelagent faalt en waar de leraar slaagt. Deze contrastgevallen vormen de basis voor het ontwerpen van het curriculum.
Vervolgens vindt de distillatie plaats tot gesaneerde capaciteitsspecificatiekaarten. Een kaart beschrijft de te testen capaciteit, relevante tools of de structuur van de workflow, waar het doel faalt en de leraar slaagt, vereiste eindtoestandseigenschappen en dimensies die kunnen variëren wanneer nieuwe taken worden bedacht. Cruciaal is dat de generator geen originele prompts, entiteiten, trajecten of verificatiegegevens ontvangt - alleen de kaarten.
Die sanering is een bewuste maatregel om overfitting tegen te gaan. Als de generator de exacte nummers van de mislukte tickets, de ID's van kennisartikelen of de docentgegevens zou zien, zou hij geneigd zijn dezelfde situatie te parafraseren. Kaarten dwingen abstractie af: leer de vaardigheid onder beheersbare variatie, niet het uit het hoofd geleerde voorbeeld.
Nadat de kaarten zijn gegenereerd, maakt het systeem er nieuwe taken van. De docent demonstreert vervolgens succesvolle leertrajecten voor begeleide bijsturing. Deze demonstraties zijn geen vrijblijvend advies; het zijn praktijkgerichte successen die dezelfde toetsingscriteria hanteren als die in het curriculum worden nagestreefd.
De schaal van de structuur bestaat uit twee fasen. De doelfase richt zich op de kern van de gevalideerde samples rondom hiaten – de taken met het sterkste signaal in de buurt van waar de zwakke agent faalt. De vermenigvuldigingsfase creëert nieuwe varianten van de geaccepteerde targets. Vermenigvuldigde samples kunnen geen nieuwe vermenigvuldigingsrondes genereren, wat drift beperkt. Deze regel is klein maar belangrijk: onbegrensde recursieve variatie kan afwijken van de functionaliteit die de kaart benoemt.
Gedeelde controller, omgevingsadapter en de bewegende grens
Qua architectuur maakt AutoSynthData gebruik van een gedeelde controller en een omgevingsadapter. De controller coördineert de diagnose, het genereren van kaarten, de demonstraties voor docenten, de kwaliteitscontroles en de batchbeoordeling. De adapter verbindt deze stappen met een concrete bedrijfsomgeving (sandbox) – tools, status, beleid en verificatie-instrumenten – zodat dezelfde besturingslus op verschillende domeinen kan worden toegepast zonder de curriculumlogica volledig opnieuw te hoeven schrijven.
Na de begeleide finetuning wordt de pipeline opnieuw geëvalueerd. Het curriculum richt zich vervolgens op de resterende lacunes: een dynamische grens in plaats van een statische dataset. De experimenten die in dit werk worden beschreven, richten zich op begeleide finetuning. Dezelfde lus zou later ook gebruikt kunnen worden voor reinforcement learning; die richting wordt als gepland beschouwd, maar niet als voltooid.
Voor bedrijfsteams is de architectuurles modulair. Controllers mogen niet één vast ticketschema coderen. Adapters moeten voldoende statusinformatie en toolgetrouwheid tonen, zodat verificatoren zinvol kunnen zijn. Het curriculum moet evaluatieresultaten als volgende input beschouwen, niet als een eenmalig scorebord.
EnterpriseOps Gym is de omgeving waarin deze aanpak werd gedemonstreerd. Het is een grootschalige testomgeving voor bedrijfsagenten met ongeveer 1150 door experts samengestelde taken verdeeld over 8 domeinen, circa 512 tools, ongeveer 164 databasetabellen, containeruitvoering, SQL-gebaseerde verificatie van resultaten, beleidsgestuurde bewerkingen, hybride scenario's over meerdere domeinen, onhaalbaarheids- en weigeringstesten en stateful trajecten met een lange horizon. AutoSynthData wordt niet gepresenteerd als de uitvinder van die gym; de gym is de stresstestomgeving voor de syntheseloop.
Kwaliteitscontrole op monsterniveau die de betrouwbaarheid van synthetische taken waarborgt
Generatie zonder poorten is hoe synthetische agentdata misgaat. AutoSynthData beschrijft kwaliteitscontrole op monsterniveau met verschillende complementaire controles.
Een filter voor de moeilijkheidsgraad van de oplosser stuurt de set naar taken die moeilijk zijn voor het doelmodel en oplosbaar voor de leraar. De beschreven configuratie geeft de voorkeur aan taken die het doelmodel in maximaal één van de drie pogingen oplost, terwijl de leraar in ten minste twee van de drie pogingen slaagt. In die bandbreedte kunnen begeleide demonstraties iets aanleren wat het zwakke model nog niet beheerst.
Positieve verificatie vereist dat een referentietraject de verificator passeert. Negatieve verificatie vereist dat gemuteerde, onjuiste uitkomsten falen. Samen testen ze zowel de acceptatie- als de afwijzingskant van de controleur. Als alleen positieve resultaten worden gecontroleerd, kan een tolerante verificator onjuiste resultaten toelaten. Als alleen negatieve resultaten worden gecontroleerd, kan een te strenge verificator geldige resultaten afwijzen.
Een feedback- en reparatiecyclus, met een herhalingslimiet, probeert taken die niet aan bepaalde criteria voldoen te herstellen in plaats van elke bijna-fout direct af te wijzen. Herhalingslimieten zijn belangrijk: eindeloos repareren kan steeds kunstmatigere beperkingen creëren om een checklist af te vinken.
Een meta-review op batchniveau bekijkt vervolgens de gehele set op volledigheid, diversiteit, redundantie en tekortkomingen. Steekproefcontroles zorgen ervoor dat individuele onderdelen deugdelijk blijven; een batchreview voorkomt dat het curriculum zich concentreert op één specifiek tekortkoming of dat er bijna identieke onderdelen ontstaan.
Deze controles verklaren waarom de pipeline urenlang duizenden samples kan produceren zonder dat volume als vervanging voor pasvorm wordt beschouwd. De snelheid verschilt per domein en docentengrootte, maar het kwaliteitscontroleproces is consistent: moeilijkheidsgraad, positieve en negatieve verificatie, reparatie met beperkingen, en vervolgens meta-review.
Onbewerkte fouten versus kaarten versus gevalideerde SFT-sets
Het is nuttig om te vergelijken waar elk artefact goed voor is. Ruwe foutenlogboeken zijn diagnostisch. Capability cards zijn generatieve contracten. Gevalideerde, begeleide fine-tuning sets zijn de basis voor de praktijktraining.
| Artefact | Wat het bevat | Kracht | Risico bij gebruik in isolatie |
|---|---|---|---|
| Ruwe foutenlogboeken | Aanwijzingen, toestanden, onderbroken trajecten, contrasten met succes van de docent | Identificeert daadwerkelijke lacunes in de praktijk | Te weinig voorbeelden; entiteiten en formuleringen kunnen gemakkelijk overfitten |
| Capability-spec kaarten | Mogelijkheden, hulpmiddelen of workflow, contrast tussen succes en falen, behoeften in de eindtoestand, variabele dimensies | Gezuiverde abstractie voor generatoren zonder dat de originelen uitlekken | Kaarten zonder kwaliteitscontrole kunnen nog steeds onmogelijke of triviale taken opleveren |
| AutoSynthData gevalideerde SFT-set | Nieuwe opdrachten plus demonstraties van docenten die de moeilijkheidsgraad, verificatie en beoordeling hebben doorstaan | Schaal de schaal aan de hand van realisme, haalbaarheid en resultaatcontroles | Het hangt nog steeds af van de bekwaamheid van de docent, de kwaliteit van de beoordelaar en de betrouwbaarheid van de omgeving |
In Hybrid- en ITSM-snapshots op EnterpriseOps Gym gebruikten de door de auteur gerapporteerde runs Gemma-4-26B-A4B-it als doelmodel. Hybrid combineerde dat doelmodel met Qwen3.8-27B als leermodel en produceerde ongeveer 2000 hybride samples in circa 18 uur, met het beste checkpoint op epoch 5. De gemiddelde Pass@1 steeg met 7,2 procentpunten - ongeveer 35 procent relatief - en het succespercentage van de verificator steeg van 63,01 procent naar 68,55 procent, waarmee het Pass@1-verschil met het referentiemodel met ongeveer 59 procent werd verkleind.
ITSM combineerde hetzelfde doel met DeepSeek-V4.1-Flash als leermodel en produceerde ongeveer 1994 samples in circa 66 uur. Dit duurde langer, deels vanwege een groter leermodel en omdat sommige pipeline-optimalisaties nog niet waren doorgevoerd. De gemiddelde Pass@1 steeg van 18,77 procent naar 27,18 procent.
| Domein | Doel | Docent | Voorbeelden en uitvoeringstijd | Uitkomst zoals gerapporteerd door de auteur |
|---|---|---|---|---|
| Hybrid | Gemma-4-26B-A4B-it | Qwen3.8-27B | ~2000 samples in ~18 uur; beste checkpoint-epoch 5 | Gemiddelde Pass@1 +7,2 pp (~35% relatief); succespercentage verificator 63,01% tot 68,55%; ~59% van het verschil tussen Pass@1 en referentie is gedicht |
| ITSM | Gemma-4-26B-A4B-it | DeepSeek-V4.1-Flash | Ongeveer 1994 monsters in ongeveer 66 uur | Gemiddelde slagingskans bij 1 toets: 18,77% tot 27,18% |
Beschouw deze cijfers als onderzoeksresultaten van het bedrijf met betrekking tot deze sportschool voor de geteste domeinen - niet als een onafhankelijke replicatie door derden, en niet als een universele bedrijfsgarantie. Resultaten worden behaald waar de bekwaamheid van de docent, de kwaliteit van de beoordelaar en de betrouwbaarheid van de omgeving op elkaar aansluiten.
Wat professionals van de loop kunnen overnemen
Zelfs als uw stack niet de onderzoekspipeline van ServiceNow is, is het patroon overdraagbaar. Begin met een gekoppelde evaluatie van een productie-achtige doelomgeving en een sterkere testomgeving in een vertrouwde sandbox. Zet contrastfouten om in capaciteitskaarten die identificatoren en trajecten verwijderen. Genereer taken die de toegestane dimensies variëren, terwijl de vereiste eigenschappen van de eindtoestand behouden blijven. Laat de testomgeving successen demonstreren. Pas de moeilijkheidsgraad aan met behulp van moeilijkheidsgraden, positieve en negatieve verificatie, beperkte reparatie en batchdiversiteitsbeoordeling. Verfijn, herzie en verleg de grenzen.
Besteed speciale aandacht aan het ontwerp van de verificator. SQL-uitkomstcontroles in de stijl van EnterpriseOps Gym en beleidsgestuurde bewerkingen illustreren waarom chatrubrieken op zichzelf zwak zijn voor stateful werk. Als uw verificator geen onderscheid kan maken tussen gemuteerde, onjuiste uitkomsten en correcte eindresultaten, zal synthetische schaalvergroting de ruis versterken.
Respecteer ook de geest van de vermenigvuldigingsregel: varianten van geaccepteerde doelen mogen niet eindeloos nieuwe varianten genereren zonder terug te keren naar beproefde kernen. Drift verloopt onopgemerkt. Een leerplan dat langzaam steeds exotischere beperkingen introduceert, kan nog steeds oppervlakkige filters doorstaan, terwijl de oorspronkelijke capaciteit onvoldoende getraind blijft.
Beschouw hybride, domeinoverschrijdend werk ten slotte als een eersteklas stresstest. Dagelijkse gebruikers blijven niet binnen één toolomgeving. Hybride taken, langetermijntrajecten en het testen van afwijzingen of onhaalbaarheid zijn de momenten waarop omgevingscompetentie zich openbaart – of juist pijnlijk faalt.
Voorbehouden, beperkingen en een zorgvuldige analyse van de voordelen
De door de auteur gerapporteerde resultaten op EnterpriseOps Gym zijn informatieve signalen, geen algemene garantie. De gepubliceerde voordelen voor Hybrid en ITSM gelden voor die domeinen en modelcombinaties onder de beschreven configuratie. Andere domeinen, zwakkere leeromgevingen, minder betrouwbare verificatiemethoden of een minder nauwkeurige omgevingssimulatie kunnen het voordeel verkleinen of tenietdoen.
Kwaliteit is afhankelijk van drie pijlers die in geen enkele marketingtruc mogen worden overgeslagen. De bekwaamheid van de docent bepaalt de bovengrens voor demonstraties. De kwaliteit van de verificator bepaalt de betrouwbaarheid van labels en filters. De overeenstemming met de omgeving bepaalt of aangeleerd gedrag standhoudt bij contact met productiesystemen, regels en de status van de gegevens.
De experimenten van AutoSynthData leggen de nadruk op supervised fine-tuning. Reinforcement learning wordt genoemd als een mogelijk later gebruik van dezelfde lus, wat in het gerapporteerde werk wel gepland, maar niet geïmplementeerd is. Lezers dienen een voor het curriculum geschikte data-engine niet te verwarren met een bewering dat er al een voltooide RL-training heeft plaatsgevonden.
Lezers moeten de synthesepipeline ook niet verwarren met de testomgeving zelf. EnterpriseOps Gym biedt de samengestelde taken, tools, tabellen, containerisatie en verificatie-infrastructuur. AutoSynthData gebruikt die omgeving om mislukkingen om te zetten in waardevolle trainingsresultaten. Beide onderdelen verdienen de juiste erkenning: de gym test agents; de pipeline vermenigvuldigt de leerbare taken op basis van vastgestelde tekortkomingen.
Ook binnen de sandbox is er geen sprake van gratis rekentijd en kalendertijd. Hybride synthese werd in ongeveer tweeduizend samples binnen enkele uren voltooid; ITSM duurde langer vanwege de intensievere begeleiding en de eerdere pipeline-structuur. Teams moeten budgetteren voor begeleidingsinferenties, herhalingen bij kritiek of reparatie, en herbeoordeling na elke curriculumstap.
Curriculumontwikkeling voor bedrijfsagentteams
Het diepste idee achter AutoSynthData is meer leerzaam dan puur generatief. Fouten worden gediagnosticeerd. Kaarten worden geabstraheerd. Generatie wordt vermenigvuldigd. Kwaliteitscontrole valideert. SFT werkt het doel bij. Her-evaluatie verlegt de grenzen. Deze volgorde beschouwt agentverbetering als een reeks omgevingsgerichte lessen in plaats van een enkele offline dump van traces.
Curriculumdenken verandert de manier waarop leiders hun inspanningen verdelen. In plaats van alleen te vragen om meer tickets of meer menselijke annotaties, moet je je afvragen welke competenties nog steeds falen bij variatie, of die competenties duidelijke eindtoestandseigenschappen hebben en of een betere docent ze betrouwbaar kan demonstreren. Als de docent niet vaak genoeg succesvol is, zal synthetische SFT onbetrouwbaar gedrag aanleren. Als de eindtoestandseigenschappen vaag zijn, zullen controleurs bezwaar maken tegen geldige strategieën.
Het verandert ook de manier waarop je over succes praat. Het dichten van een deel van de Pass@1-kloof ten opzichte van een referentiemodel op Hybrid, of het verhogen van de ITSM Pass@1-score van rond de 15 naar 25 procent in door de auteur gerapporteerde tests, is vooruitgang op het gebied van gemeten omgevingscompetentie. Het is geen bewijs dat elke workflow, elk beleid of elk afwijzingsgeval is opgelost. Blijf de term 'bewegende grens' gebruiken: resterende hiaten worden de volgende doelfase, geen dia die achteraf wordt toegevoegd.
Bij het ontwerpen van programma's is het aan te raden deze lus te combineren met menselijke beoordeling waar veel op het spel staat – veiligheidsvoorschriften, onomkeerbare acties, gereguleerde gegevens – terwijl geautomatiseerde poorten de grote hoeveelheid gegevens verwerken op basis van goed gespecificeerde statuscontroles. Synthetische data werkt het best wanneer de omgeving met SQL-achtige duidelijkheid ja of nee kan aangeven. Het werkt minder goed wanneer succes subjectief is.
Ontwerpnotities over moeilijkheidsgraad, realisme en afwijzing
De moeilijkheidsgraad moet opnieuw onder de loep worden genomen. Door taken te kiezen die de leerling maximaal een derde van de tijd oplost, wordt voorkomen dat de training triviaal wordt. Door van de docent te eisen dat hij of zij minstens twee derde van de tijd slaagt, worden demonstraties minder kinderachtig. Die grens is een praktisch compromis tussen uitdaging en leerbaarheid.
Realisme blijft een minder strikt criterium, maar is nog steeds essentieel. Zakelijke gebruikers vragen om dingen die aansluiten bij hun rollen en systemen. Generatoren die zich uitsluitend laten leiden door harde regels kunnen ingewikkelde puzzels met meerdere beperkingen bedenken die geen enkele operator zou aanvragen. Capability cards die variabele dimensies vermelden, zijn nuttig, maar mensen of meta-review moeten nog steeds surrealistische aanwijzingen herkennen.
Tests op weigering en onhaalbaarheid, die onderdeel uitmaken van het bredere ontwerp van EnterpriseOps Gym, herinneren teams eraan dat competentie ook inhoudt dat ze nee kunnen zeggen. Een pipeline die alleen geoptimaliseerd is voor taken die voltooid kunnen worden, kan het weigeren onvoldoende trainen. Voeg bij het uitbreiden van lussen in de stijl van AutoSynthData kaarten toe waarbij de juiste eindeigenschap een veilige weigering volgens het beleid is, en niet alleen een succesvolle wijziging van de databasestatus.
Langetermijntrajecten met een vaste status vereisen een andere ontwerpvraag. Docentdemonstraties moeten consistent blijven bij meerdere toolaanroepen. Verificatiesystemen die alleen de laatste tabelrij controleren, kunnen tussentijdse beleidsoverschrijdingen missen. Volledigheid in het ontwerp van verificatiesystemen betekent dat alle eigenschappen die het succes van die functionaliteit bepalen, worden afgedekt – inclusief beperkingen die gedurende het hele proces moeten gelden, niet alleen aan het einde.
Afsluitende samenvatting
AutoSynthData, afkomstig van ServiceNow CoreAI / ServiceNow-AI en beschreven in de openbare documentatie door Esakkivel Esakkiraja, is een pipeline die mislukkingen van doelagenten en successen van leeragenten omzet in gevalideerde synthetische trainingstaken voor bedrijfsomgevingen. Het abstraheert mislukkingen tot gezuiverde capaciteitsspecificatiekaarten, genereert nieuwe taken zonder de oorspronkelijke prompts of trajecten te lekken, verzamelt demonstraties van leeragenten en handhaaft kwaliteitscontrole op steekproef- en batchniveau vóór de begeleide finetuning.
Het praktische mentale model is een taak die fungeert als systeemspecificatie, gebruikersprompt en verificator – waarbij haalbaarheid, realisme en moeilijkheidsgraad in evenwicht worden gehouden, en waarbij de verificatoren niet te laks zijn en niet aan één pad gebonden. De fasen 'Doel' en 'Vermenigvuldigen', een regel die geen verdere seed-generatie toestaat voor vermenigvuldigde samples, een gedeelde controller plus omgevingsadapter en een herbeoordeling na SFT creëren een bewegende grens over de resterende hiaten.
Op EnterpriseOps Gym laten de door de auteur gerapporteerde hybride resultaten met Gemma-4-26B-A4B-it en Qwen3.8-27B zien dat er in ongeveer achttien uur tijd zo'n tweeduizend samples zijn getest, met significante verbeteringen in Pass@1 en het succespercentage van de verifier. Dit dicht een groot deel van de kloof met een referentiemodel. ITSM met DeepSeek-V4.1-Flash als teacher laat zien dat Pass@1 stijgt van 18,77 procent naar 27,18 procent op ongeveer 1994 samples over een langere periode. Beschouw deze cijfers als onderzochte signalen op specifieke domeinen, afhankelijk van de betrouwbaarheid van de teacher, verifier en omgeving. Houd reinforcement learning in gedachten als een geplande uitbreiding van de cyclus, niet als een afgeronde bewering.
Onthoud één zin: bedrijfsmedewerkers verbeteren wanneer fouten worden omgezet in abstracte, vermenigvuldigde en geverifieerde lessen binnen de systemen waarmee ze dagelijks moeten werken – niet wanneer teams simpelweg hetzelfde defecte ticket blijven herhalen.
Praktisch voorbeeld: Het uitbreiden van complexe ITSM-cases vanuit een bevroren set met fouten in Gym-stijl
Scenario
Een Brits enterprise platformteam – denk aan een middelgrote financiële dienstverlener die ITSM in ServiceNow-stijl gebruikt met change window-functionaliteit, CMDB-relaties en beleidsgestuurde transities – heeft een agent die in productieomgevingen werkt, maar steeds tegen hetzelfde soort werk aanloopt: updates tussen tabellen die aan een goedkeuringsvereiste moeten voldoen, zoekopdrachten in kennisartikelen die conflicteren met lokale wijzigingsbeperkingen en hybride verzoeken die ITSM overstijgen en in aangrenzende operationele tools worden uitgevoerd.
Ze bevriezen een privé EnterpriseOps Gym-achtige suite (gecontaineriseerde sandbox, SQL-uitkomstcontroles, vooraf ingestelde tabellen, beleidsregels) zodat scores van week tot week vergelijkbaar zijn. Diagnostische tests tonen aan dat de doelagent faalt waar een sterkere trainer slaagt. Het management wil meer trainingssignalen zonder steeds dezelfde ticketnummers en entiteits-ID's te hoeven herhalen. AutoSynthData (of een equivalente lus voor het synthetiseren van fouten als de onderzoekspipeline in hun stack is opgenomen) is de kandidaat: zet contrastfouten om in gezuiverde capaciteitsspecificatiekaarten, genereer nieuwe taken, verzamel demonstraties van de trainer en - cruciaal - laat synthetische traceringen door mensen beoordelen voordat er opnieuw getraind wordt.
Niets wordt los verzonden via Gym Pass@1. Synthetische data wordt beschouwd als kandidaat-curriculum, niet als absolute waarheid.
Wat de assistent nodig heeft
- Toegang tot de bevroren Gym-achtige omgevingsadapter: tools, seed-status, beleid en SQL-verificatie (of een equivalent op status gebaseerd systeem).
- Gekoppelde evaluatielogboeken: mislukkingen van de doelgroep vergeleken met successen van de leerkracht bij dezelfde taken.
- Een kaartschema dat mogelijkheden, tools/workflowstructuur, faal-/succescontrast, vereiste eindtoestandseigenschappen en toegestane variatiedimensies vastlegt - zonder originele prompts, entiteiten, trajecten of interne verificatie-elementen.
- Regels voor het screenen van persoonsgegevens en beleid (ticket-ID's, gebruikersnamen, CI-namen, gereguleerde velden) worden uitgevoerd voordat iets de sandbox verlaat of een generatorprompt binnenkomt.
- Een wachtrij voor menselijke beoordeling van steekproefsgewijs samengestelde synthetische taken en feedback van docenten (haalbaarheid, realisme, betrouwbaarheid van de verificator, gevallen van weigering/onhaalbaarheid).
- Duidelijke stopvoorwaarden: Doel- en vermenigvuldigingsfasen; vermenigvuldigde monsters dienen niet als uitgangspunt voor verdere vermenigvuldigingsrondes.
Voorbeeldinstructie
Het platform leidt naar de curriculumbeheerder (of naar een orchestratieassistent die alleen kaarten opstelt en pakketten beoordeelt - deze voert geen hertraining of promotie van modellen uit):
Voer een diagnostische Pass@1 uit op de bevroren ITSM- en hybride slices ten opzichte van ons huidige doel en de aangewezen trainer. Voor elk contrast waarbij het doel faalt en de trainer minstens twee van de drie tests succesvol afrondt, stelt u een geanonimiseerde capability-specificatiekaart op: benoem de capability, som de relevante tools op, geef de vereiste eindtoestandseigenschappen aan en som de beheersbare dimensies op (prioriteitsband, gerelateerde CI-klasse, wijzigingsvenstervlag, type kennisconflict). Verwijder ticketnummers, gebruikers-ID's, CI-namen en ruwe trajecten. Genereer een batch nieuwe taken voor de doelfase op basis van alleen deze kaarten. Laat de trainer de successen demonstreren. Pas een moeilijkheidsgraad toe (doel ≤1/3, trainer ≥2/3), positieve en negatieve verificatie en beperkte kritiek/reparatie. Stel een reviewpakket samen met 5% gestratificeerde steekproeven plus elke weigerings-/onhaalbaarheidskaart. Start de SFT pas nadat twee reviewers het pakket hebben goedgekeurd en de PII-scrubcontroles zijn geslaagd. Na de SFT op een kandidaat-checkpoint, voert u een herbeoordeling uit op de bevroren suite en op een holdout-set met exacte overeenkomsten die we nooit hebben gebruikt. voor generatie. Rapporteer de dekking per faalklasse en het regressiepercentage ten opzichte van het vorige productiecontrolepunt. Bevorder niet uitsluitend op basis van de Gym-score.”
Hoe test je het?
- Basisvergrendeling: Registreer de Pass@1- en verificatiesuccespercentages op de bevroren suite per faalklasse (volgorde van vereisten, weigering van wijzigingsvenster, hybride cross-tool, kennisconflict). Houd de suite en de seeds onveranderlijk gedurende de cyclus.
- Kaartcontrole: Controleer steekproefsgewijs of de generatoren nooit originele prompts, entiteiten of docentgegevens ontvangen, maar alleen kaarten.
- Kwaliteitscontrole van het voorbeeld: Bevestig dat positieve trajecten de verificatie doorstaan en dat gemuteerde, onjuiste uitkomsten afwijzen. Verwerp taken die triviaal zijn voor de doelgroep of een gok voor de docent.
- Menselijke beoordeling: Beoordelaars geven voor elk voorbeeld aan of het behouden, repareren of afwijzen is op basis van haalbaarheid, realisme en beleidsveiligheid. De overeenstemming tussen beoordelaars over een gezamenlijke subset wordt bijgehouden.
- Holdout exact match: Na de kandidaat SFT, beoordeel een holdout van echte (of eerder bevroren) taken die nooit als input zijn gebruikt voor het genereren of verwerken van kaarten. Beoordeel afzonderlijk bijna-parafrases van trainingstaken om oppervlakkige memorisatie te detecteren.
- Regressiepoort: Elke foutklasse die verergert ten opzichte van het vorige productiecontrolepunt blokkeert de promotie totdat de oorzaak is achterhaald of het probleem is opgelost.
Resultaat
Verzin hier geen bakwedstrijdpercentages. Gebruik een meetplan en label gepubliceerde onderzoeksresultaten als ARTIKELCLAIM wanneer u ze citeert.
Meetplan (wat dit team moet rapporteren):
- Dekking van de faalklassen: aandeel van de gediagnosticeerde gap-klassen die ≥N geaccepteerde taken in de doelfase hebben opgeleverd na kwaliteitscontrole (definieer N vooraf, bijvoorbeeld 20 geaccepteerde taken per klasse).
- Holdout exact match: Pass@1 / verificatie succesvol op de ongewijzigde holdout vóór versus na kandidaat SFT (zelfde seeds, zelfde verificator).
- Regressiepercentage: aantal faalklassen waarbij Pass@1 niet wordt gehaald ten opzichte van het vorige productiecontrolepunt; blokkeer als een veiligheidskritieke klasse een regressie vertoont.
- Reviewopbrengst: behoud/repareer/verwijder de percentages van de menselijke review; als het verwijderingspercentage plotseling stijgt, pauzeer dan Multiply en repareer de kaarten of verificatoren.
- Scrubfouten: aantal samples dat niet voldoet aan de PII/beleidscontroles vóór de definitieve beoordeling (doel: nul gevallen waarin gegevens in de SFT-set terechtkomen).
BEWERING UIT HET ARTIKEL (door de auteur gerapporteerd op EnterpriseOps Gym - niet het gemeten resultaat van dit team): Hybride tests met Gemma-4-26B-A4B-it als doel en Qwen3.8-27B als leraar leverden ongeveer 2000 samples op in circa 18 uur, met een gemiddelde Pass@1-score die met ongeveer 7,2 procentpunten steeg en een verificatiesucces van 63,01% naar 68,55%. ITSM met DeepSeek-V4.1-Flash als leraar verhoogde de gemiddelde Pass@1-score van 18,77% naar 27,18% op ongeveer 1994 samples over een langere testperiode (~66 uur). Beschouw deze resultaten als onderzochte signalen voor specifieke domeinen en combinaties, niet als een universele garantie voor een productieomgeving in het Verenigd Koninkrijk.
Illustratieve programmastructuur (aannames, geen gemeten resultaten): Als het team ongeveer 2000 QC-gecontroleerde samples accepteert voor één ITSM-cyclus, budgetteert voor de inferentie en beoordeling van docenten met een gestratificeerde steekproef van 5%, en alleen promoveert wanneer de testresultaten geen achteruitgang laten zien in veiligheidskritieke lessen, dan is het "resultaat" dat ze zonder blikken of blozen kunnen claimen procesvolwassenheid - gecontroleerd curriculum, opgeschoonde sporen en vergelijkbare verschillen in bevroren lesomgevingen - en niet een beloofde procentuele verbetering.
Wat kan er misgaan?
- Synthetische informatie als vrije waarheid beschouwen: het overslaan van menselijke beoordeling of negatieve verificatie stelt tolerante controleurs in staat om op grote schaal onzin toe te laten.
- Entiteitslekkage: Het invoeren van originele ticket-ID's of docentgegevens in de generator leidt tot overaanpassing van de parafrase; er bestaan kaarten om dat te voorkomen.
- Onbegrensde vermenigvuldiging: Het toestaan dat vermenigvuldigde samples de basis vormen voor volgende rondes wijkt af van de genoemde functionaliteit.
- Gym-score verzending: Promotie omdat de Pass@1-score voor bevroren suites steeg, terwijl het verkeer van achterblijvers of productieschaduwen verslechterde.
- Zwakke leerlimiet voor docenten: Als de docent de succesgrens van ≥2/3 niet haalt, geeft SFT onbetrouwbare demonstraties.
- Vage verificatiecriteria: Chatrubrieken in plaats van statusgebaseerde controles beoordelen vloeiende, foute eindtoetsen als een succes.
- Ondertrainingsweigering: Optimalisatie uitsluitend voor voltooibare mutaties maakt het veranderingsvenster en de beleidsafname kwetsbaar.
- PII-escape: Synthetische prompts die na een oppervlakkige filtering de echte CI- of gebruikersnamen opnieuw weergeven.
Praktische tips
Gebruik lussen in de stijl van AutoSynthData - of een equivalent patroon voor het synthetiseren van fouten als de ServiceNow CoreAI-pipeline niet beschikbaar is in uw tenant - om harde, verifieerbare ITSM-cases te genereren op basis van vastgestelde tekortkomingen. Verwerk de gegevens in capaciteitskaarten, stel poorten in met moeilijkheidsgraad en positieve/negatieve verificatie, verwijder persoonsgegevens en laat steekproeven door mensen beoordelen vóór de implementatie. Meet de dekking van de foutklassen, de exacte overeenkomst in de testomgeving en het regressiepercentage. Citeer de Gym-cijfers in het artikel alleen als externe onderzoekscontext. Synthesedata is brandstof voor het curriculum, geen garantie: controleer steekproeven, houd de suite bevroren voor een eerlijke vergelijking en lever nooit alleen op basis van de Gym-score.
Veelgestelde vragen
Wat is AutoSynthData en welk probleem pakt het aan?
AutoSynthData is een ServiceNow CoreAI / ServiceNow-AI pipeline, beschreven door Esakkivel Esakkiraja, die de mislukkingen van een doelagent combineert met de successen van een sterkere leeragent in gevalideerde synthetische trainingstaken voor bedrijfsomgevingen. Het richt zich op omgevingscompetenties – lokaal beleid, schema's, tools en status – in plaats van op algemene kennis. Het doel is om moeilijk, controleerbaar werk te vermenigvuldigen, zodat gecontroleerde fine-tuning omgevingsspecifieke tekortkomingen kan verhelpen in plaats van steeds hetzelfde foutieve ticket opnieuw af te spelen.
Waarom is omgevingscompetentie anders dan brede modelbekwaamheid?
Enterprise-agents lopen vaak vast omdat de omgeving zelf specifiek is: ticketbeleid, schema-eigenaardigheden, toolcontracten, vooraf ingestelde databases en workflows tussen systemen. Een model dat er op basis van open benchmarks sterk uitziet, kan nog steeds vastlopen bij een wijzigingsvenster, een CMDB-relatie of een verificatie die de uiteindelijke status inspecteert. Brede functionaliteit is niet hetzelfde als weten hoe uw systemen, regels en gegevensstatus zich gedragen tijdens beleidsgestuurde overgangen.
Welke praktische taakvorm gebruikt AutoSynthData?
Een werkbare structuur bestaat uit een taak die gelijk is aan een systeemspecificatie, een gebruikersprompt en een verificator. De systeemspecificatie bevat beperkingen, beleidsregels en een beginsituatie zoals database-seeds en kennisartikelen. Gebruikersprompts worden beoordeeld op haalbaarheid, realisme en moeilijkheidsgraad. Verificatoren maken idealiter gebruik van SQL-gebaseerde of statusgebaseerde uitkomstcontroles, zodat ze de wereld beoordelen nadat de agent heeft gehandeld, en niet alleen het exacte pad dat de token heeft afgelegd.
Hoe voorkomen kaarten met geoptimaliseerde capaciteitsspecificaties overfitting?
Diagnostische tests vergelijken de gevallen waarin het doel faalt en de docent slaagt, en destilleren die gevallen vervolgens tot geanonimiseerde specificatiekaarten. Een kaart registreert de vaardigheid, de tools of de workflow, het verschil tussen slagen en falen, de vereiste eigenschappen van de eindtoestand en de dimensies die kunnen variëren. De generator ziet nooit de originele prompts, entiteiten, trajecten of verificatiegegevens - alleen de kaarten - zodat nieuwe taken de kern van de taak raken zonder een uit het hoofd geleerde situatie te herhalen.
Wat zijn de Target- en Multiply-fasen in de pipeline?
De doelfase concentreert zich op de kern van gevalideerde samples rondom hiaten – de taken met het sterkste signaal in de buurt van waar de zwakke agent faalt. De vermenigvuldigingsfase genereert nieuwe varianten van geaccepteerde doelen. Vermenigvuldigde samples kunnen geen nieuwe vermenigvuldigingsrondes initiëren, waardoor afwijkingen van de beoogde functionaliteit onder controle worden gehouden. Na een begeleide verfijning verschuift de herbeoordeling het leerplan naar de resterende hiaten als een bewegende grens in plaats van een statische opslagplaats.
Hoe zorgt kwaliteitscontrole op monsterniveau ervoor dat synthetische taken betrouwbaar blijven?
Een filter voor de moeilijkheidsgraad van de oplosser geeft de voorkeur aan taken die het doel in maximaal één van de drie pogingen oplost, terwijl de leraar in ten minste twee van de drie pogingen slaagt. Positieve verificatie vereist een referentietraject om te slagen; negatieve verificatie vereist gemuteerde, foute uitkomsten om te falen. Een feedback- en reparatielus met een herhalingslimiet probeert bijna-fouten te herstellen, en een meta-review op batchniveau controleert de dekking, diversiteit, redundantie en falende doelen binnen de set.
Welke architectuur gebruikt AutoSynthData binnen de verschillende bedrijfsdomeinen?
Het combineert een gedeelde controller met een omgevingsadapter. De controller voert diagnose, kaartgeneratie, lesmateriaal, demonstraties voor docenten, kwaliteitscontroles en batchbeoordeling uit. De adapter koppelt deze stappen aan een concrete testomgeving (sandbox) – tools, status, beleid en verificatie-elementen – zodat dezelfde besturingslus naar verschillende domeinen kan verwijzen zonder de curriculumlogica volledig opnieuw te hoeven schrijven.
Wat is EnterpriseOps Gym in deze onderzoekscontext?
EnterpriseOps Gym is de grootschalige testomgeving voor bedrijfsagenten die wordt gebruikt als stresstestomgeving. Deze omvat ongeveer 1150 door experts samengestelde taken verdeeld over 8 domeinen, circa 512 tools, ongeveer 164 databasetabellen, containeruitvoering, SQL-gebaseerde resultaatverificatie, beleidsgestuurde bewerkingen, hybride scenario's en stateful trajecten met een lange horizon. AutoSynthData wordt niet gepresenteerd als de uitvinder van deze gym; de gym laat de syntheseloop in actie zien.
Welke door de auteurs gerapporteerde resultaten zijn er voor hybride en ITSM-omgevingen?
Op EnterpriseOps Gym produceerden hybride tests met Gemma-4-26B-A4B-it als doelapparaat en Qwen3.8-27B als leerapparaat ongeveer 2000 samples in circa 18 uur, met een gemiddelde Pass@1-score die met ongeveer 7,2 procentpunten steeg en een verificatiesucces van 63,01% naar 68,55%. ITSM met DeepSeek-V4.1-Flash als leerapparaat verhoogde de gemiddelde Pass@1-score van 18,77% naar 27,18% op ongeveer 1994 samples over een langere testperiode. Beschouw deze resultaten als onderzochte signalen voor specifieke combinaties, niet als een universele productiegarantie.
Welke fouten moeten teams vermijden bij het gebruik van synthese-van-fouten-loops?
Beschouw synthetische data niet als absolute waarheid en sla menselijke controle en negatieve verificatie niet over. Voer geen originele ticket-ID's of docentgegevens in de generator, laat geen vermenigvuldigde voorbeelden verdere rondes genereren en promoot Gym Pass@1 niet op zichzelf terwijl het aantal achterblijvers of schaduwgebruikers toeneemt. Let ook op zwakke docenten onder de succesgrens, vage chatrubrieken in plaats van officiële controles, gevallen van weigering door onvoldoende training en het ontsnappen van persoonsgegevens na een oppervlakkige controle.
Referenties
- Hugging Face — AutoSynthData — huggingface.co
- EnterpriseOps Gym — enterpriseops-gym.github.io
- arXiv — arxiv.org
- GitHub — EnterpriseOps-Gym — github.com