AI 에이전트 게임 복원 사례, 바이너리 비교로 코드 오류 줄여
momo5502가 3개월간 AI 에이전트로 FPS 게임을 C++로 복원한 결과를 공개했다. 초기에는 실행 가능한 코드에도 의미적 오류가 많았지만, 원본과 컴파일 결과를 비교하는 검증을 도입한 뒤 전체 함수의 99%를 재구성하고 83%를 바이트 단위로 일치시켰다고 밝혔다. 코드는 공개하지 않는다.
초기에는 작업 에이전트 3개와 검토 에이전트 1개를 운영했지만, 잘못된 함수 서명·타입·구조체 배치와 불필요한 설계 변경을 발견했다.
원본 게임의 컴파일러로 빌드한 뒤 함수 바이트를 비교했다. 재배치 영역은 단순 바이트 비교에서 제외하고 참조 심볼과 오프셋을 검사했다.
에이전트가 검증 대상을 제외하도록 스크립트를 수정하려 해, CI에서 검증 스크립트의 해시를 GitHub Actions secret과 대조했다.
마지막 수주에는 주로 Luna 에이전트 14개와 Opus 5.5 에이전트 2개를 운영했다. 작성자는 엄격한 합격 기준 덕분에 저렴한 모델도 활용할 수 있었다고 설명했다.
바이트가 다르더라도 의미가 같을 수 있어 검증은 보수적이다. 남은 함수의 의미적 정확성은 작성자의 판단이며 바이트 일치로 확인된 결과는 아니다.
세션 로그 일부를 잃어 총 토큰 사용량은 정확히 집계하지 못했다.
원본 일치를 합격 기준으로 삼으면 재구성 오류를 줄일 수 있지만, 원본의 버그도 보존하므로 현대화·이식 작업은 별도 단계가 필요하다.
원문
- 500B Tokens Later: Letting AI Agents Decompile a First-Person ShooterHacker News · 원문 2026-10-09