Pulse 게시 ·

딥마인드 연구자, AI 평가에 현지 언어·문화 반영 제안

구글딥마인드의 로라 아로요 수석 과학자가 10월 6일 AI 페스타에서 영어 중심 벤치마크의 개편을 제안했다. 모델은 약 70~100개 언어를 지원하지만 다수 평가는 10~20개 언어에 그친다는 설명이다. 영어 문항의 번역을 넘어 현지 전문가가 평가 자료를 만들고, 안전성과 문화적 적절성을 따로 측정해야 한다고 주장했다.

아로요는 영어 문항을 번역하면 상황은 전달할 수 있어도 현지의 문화적 배경과 사회적 의미를 충분히 반영하기 어렵다고 설명했다.

텍스트뿐 아니라 지역적 맥락이 담긴 이미지의 이해 능력도 평가해야 한다고 제안했다.

물리적 위해가 없는 답변이라도 특정 문화의 예절이나 금기를 위반할 수 있어 안전 여부만으로 평가하기 어렵다는 주장이다.

평가 범위를 챗봇에서 AI 에이전트와 피지컬 AI로 넓히고, 평가자로 쓰는 LLM에도 지역·소수 집단 관점이 반영되는지 검증해야 한다고 밝혔다.

한국어 서비스 평가에는 문법적 유창함 외에도 높임말·관용 표현·현지 관습을 지키는지 확인하는 문항이 필요하다는 제안이다.

원문