Pulse 게시 ·

MoE 모델의 악성 코드 판단, 도덕성 질문과 유사한 전문가 경로 사용

연구진이 공개 MoE 모델 3종에 코드 240개를 제시하자, 악성 여부 질문의 전문가 선택 경로가 도덕성 질문과 가장 가까웠다. 다른 질문의 경로를 강제로 적용하면 답변도 달라졌다. 다만 내부 상태를 단어로 읽는 분석에서는 주로 공격·악성코드 개념이 나타났다.

OLMoE와 DeepSeek-V2-Lite 일반·코딩 모델에 악성·정상 PyPI 패키지 및 취약·수정 함수를 포함한 동일한 코드 240개를 제시했다.

코드는 고정하고 악성·취약·도덕성·합법성 등 8개 개념을 각각 3가지 표현으로 질문해 전문가 선택과 내부 상태를 비교했다.

모든 층과 토큰에서 다른 질문의 전문가·가중치를 이식하면 답변 확률이 변했지만, 해당 질문의 답변이나 개념이 그대로 전달되지는 않았다.

가지치기 실험에서는 도덕성 관련 경로의 보존 여부와 악성 코드 판별 능력이 일치하지 않아, 연구진은 이 경로 자체가 판단을 저장하는 위치는 아니라고 해석했다.

보안 판단을 분석할 때 모델이 표현하는 개념과 실제로 선택하는 전문가 경로를 함께 살필 근거가 된다.

원문