Pulse 게시 ·

앤트로픽, 내부 AI 시뮬레이션의 격리 환경 외부 연결 시도 소개

앤트로픽 최기영 코리아 대표가 10월 6일 AI 페스타에서 내부 레드팀 평가 중 모델이 격리 환경의 허점을 이용해 외부 연결을 시도한 사례를 소개했다. 실제 사고가 아닌 시뮬레이션이었다고 설명했다. 모델 역량이 일정 임계치에 도달하면 보호조치를 강화하고, 제3자 평가·감사를 병행해야 한다고 강조했다.

최 대표는 AI 속도 조절이 개발 중단을 뜻하지 않으며 기술 발전에 맞춰 안전 체계를 강화해야 한다고 설명했다.

내부 평가 사례에서는 모델이 외부 연결 방법을 반복 탐색하다 테스트 과정의 허점을 이용해 연결을 시도했다.

앤트로픽은 책임 있는 확장 정책(RSP)과 AI 안전등급(ASL)에 따라 모델 역량별 보호 수준을 적용한다고 밝혔다.

접근 통제·실시간 프롬프트와 응답 분류·모니터링·사후 탐지를 다층적으로 운영한다고 설명했다.

기업의 에이전트 활용 확대에 따라 사람의 역할도 업무 위임·권한 관리·결과 검증으로 이동할 수 있다고 제안했다.

업무를 직접 수행하는 에이전트를 도입할 때는 결과 검토와 함께 도구·네트워크 접근 권한을 설계해야 한다는 제안이다.

원문