Microsoft, 코딩 에이전트의 SDK·도구 활용 오류를 평가하는 AX 지침 공개
Microsoft가 코딩 에이전트의 기술 활용을 평가하고 문서·도구를 개선하는 AX Practitioner Playbook과 스킬을 공개했다. 실행 가능 여부를 확인하는 평가 관문, 판정 기준 설계, 도구 호출 기록을 통한 원인 분석을 다룬다. SDK·API·CLI·MCP·스킬 개발자와 문서 작성자가 대상이며 특정 평가 시스템에 종속되지 않는다.
Microsoft DevRel이 Azure·Cosmos DB·SharePoint Framework·Microsoft 365 Copilot 확장 등을 대상으로 수행한 에이전트 평가 경험을 모았다.
컴파일되지 않는 코드에도 만점을 주는 평가 오류를 예로 들며, 의미를 판단하는 기준과 실제 실행을 증명하는 관문을 함께 설계하도록 안내한다.
평가 기준은 사전 보정하고 제품 변경에 맞춰 버전 관리한다. 모델에 기준 작성을 그대로 맡기는 방식의 함정도 다룬다.
확장이 로드되지 않았는지, 로드됐지만 호출되지 않았는지, 호출 후 잘못 적용됐는지를 실행 기록으로 구분한다. 반복되는 실패 유형 9종과 먼저 점검할 지점을 제시한다.
제안한 문서·확장 변경을 가설로 시험한 뒤 담당 팀에 근거를 전달하는 절차를 제공한다. 사례 평가를 통해 Azure Cosmos DB Agent Kit 개선 46건을 포함한 수정이 이뤄졌다고 설명했다.
함께 공개한 AX Practitioner 스킬은 지침을 바탕으로 질문에 답하고 평가 시나리오·기준을 검토한다. Microsoft가 제시한 330개 질문 평가의 평균 점수는 지침 내용 대비 95%다.
도구가 로드되지 않은 경우와 호출됐지만 잘못 적용된 경우를 구분하면, 설명 보강과 도구 구현 수정 중 어디에 손댈지 정하기 쉽다.
원문
- Introducing the Agent Experience (AX) Practitioner PlaybookMicrosoft Developer · 원문 2026-10-09