AI 12종 추천 비교, 모델 간 합의와 정답은 별개
개인 개발자가 AI 12종에 영어로 ‘상위 3개’를 묻는 도구의 초기 수백 개 질문을 분석했다. 다른 모델과의 추천 일치도는 중국 모델 평균 0.47, 미국 모델 0.38이었다. 저가 모델 중심의 임의 표본이며, 정확도나 차이의 원인을 입증한 결과는 아니다.
각 모델에는 다른 모델의 의견을 추측하지 말고 독립적으로 1~3위를 답하도록 요청했다. 같은 대상을 다르게 부른 답은 Gemini Flash로 통합했다.
나머지 11종의 합의와 비교해 대상·순위가 모두 같으면 온점수, 대상만 같으면 절반 점수를 부여했다.
중국 5종·미국 6종·유럽 1종으로 구성했고, 실험자 개인 사용과 Reddit 유입 이용자의 초기 질문을 사용했다.
OpenRouter에서 주로 저렴한 Flash·소형 모델을 호출했으며, 가능한 경우 추론을 껐다. Temperature는 조정하지 않았다.
증류·학습 데이터·모델 규모 등은 작성자가 제시한 가설이며, 관찰된 일치도의 원인으로 확인되지 않았다.
여러 모델의 다수결로 추천을 고르면 패널 구성이 결과를 좌우하므로, 소수 의견도 별도로 보여주는 편이 선택지를 넓힌다.
원문
- AI Model Groupthinkmagicnumbers.io · 원문 2026-10-08