IT

독파모 2차 평가 공개…모티프·SKT·LG AI연구원 항목별 강점 엇갈려

류청빛 기자 2026-08-20 17:54:50
당초 세부 점수 비공개 방침서 선회…평가 투명성 논란에 1차와 동일 수준 공개 기술 독자성·개발 전략·생태계 파급효과 등 평가…'무빙타깃' 대응 전략도 반영
과학기술정보통신부 로고

[경제일보] 정부가 '국가대표 AI' 육성을 위해 추진 중인 독자 AI 파운데이션 모델 프로젝트의 2차 단계 평가 세부 기준과 결과를 공개했다. 이번 평가는 글로벌 AI 벤치마크뿐 아니라 국내 환경에 맞춘 성능 평가, 전문가 평가, 실제 사용자 평가까지 반영한 것이 특징이다. 당초 항목별 1위 기업과 점수를 공개하지 않는다는 방침이었지만 평가 투명성을 둘러싼 논란이 제기되자 1차 평가와 동일한 수준으로 공개 범위를 확대했다.

20일 과학기술정보통신부는 최근 발표한 독자 AI 파운데이션 모델 프로젝트 2차 단계 평가의 기준과 결과를 공개했다고 밝혔다. 이번 평가에는 SK텔레콤, LG AI연구원, 모티프테크놀로지스 등 4개 정예팀이 참여했다.

이번 2차 평가는 총 100점 만점으로 벤치마크 평가 40점, 전문가 평가 35점, 사용자 평가 25점으로 구성됐다. 단순히 AI 모델의 벤치마크 성능만 비교하는 방식에서 벗어나 기술적 독자성, 개발 전략, 생태계 파급 효과, 실제 사용성 등을 종합적으로 평가한 것으로 알려졌다.

가장 큰 비중을 차지한 벤치마크 평가는 글로벌 평가와 국내 평가로 나뉜다. 글로벌 평가에는 'AAII'에서 활용하는 벤치마크를 적용해 에이전트, 코딩, 일반 지식, 과학적 추론 등 분야의 성능을 평가했다. 국내 평가는 한국지능정보사회진흥원(NIA) 벤치마크를 활용해 수학, 지식, 장문 이해, 안전성, 신뢰성, 한국어, 지시 이행 등 7개 분야를 평가했다.

글로벌 AAII 평가에서는 모티프테크놀로지스 정예팀이 11.9점으로 가장 높은 점수를 받았다. NIA 벤치마크에서는 SK텔레콤 정예팀이 13.4점으로 최고점을 기록했다. 4개 팀의 AAII 평균 점수는 9.48점, NIA 벤치마크 평균은 13.05점이었다.

전문가 평가는 외부 전문가 10명으로 구성된 평가위원회가 진행했다. 산업계 3명, 학계 5명, 연구계 2명이 참여했으며 정예팀이 제출한 자료를 바탕으로 약 5일간 서면 평가와 질의응답을 진행했다.

전문가 평가는 개발 전략 및 기술 10점, 개발 성과 및 계획 10점, 생태계·글로벌 파급효과 및 기여 계획 15점으로 구성됐다. 특히 이번 2차 평가에서는 1차 평가 이후 제기된 AI 모델의 독자성과 활용성에 대한 요구를 반영했다. 향후 AI 기술 변화에 대응하는 '무빙타깃' 전략과 차세대 기술 도입 계획 등도 평가 대상에 포함됐다.

전문가 평가에서는 LG AI연구원 정예팀이 29.5점으로 최고점을 기록했다. 4개 팀 평균은 28.75점이었다.

실제 이용자가 AI 모델을 어떻게 평가하는지도 점수에 반영됐다. 사용자 평가는 AI 전문 사용자와 일반 국민으로 나눠 진행됐으며 AI 스타트업 대표 등 전문 사용자 49명과 일반 국민 185명이 실제 평가에 참여했다.

전문 사용자 평가는 15점 만점으로 환산됐으며 SK텔레콤 정예팀이 11.6점으로 가장 높은 점수를 받았다. 일반 국민 평가에서는 LG AI연구원 정예팀이 7.6점으로 최고점을 기록했다. 일반 국민 평가단은 성별과 연령별 쿼터를 적용해 무작위로 선정됐다.

글로벌 벤치마크에서는 모티프테크놀로지스, 국내 벤치마크와 전문 사용자 평가에서는 SK텔레콤, 전문가 평가와 일반 국민 평가에서는 LG AI연구원이 각각 최고점을 기록했다.

과기정통부 관계자는 "독파모 프로젝트는 단순한 순위 경쟁이나 탈락 팀 선정을 목적으로 하는 것이 아니라, 우리 AI 기업들이 경쟁을 넘어 성장하고, 국내 AI 생태계의 질적 성장과 확장을 견인하는 데 그 취지가 있다"며 "평가 결과 공개에 따른 일부 기업의 예기치 않은 직·간접적 피해를 최소화하는 한편, 평가 과정 결과에 대한 공정성과 투명성이라는 가치 역시 균형 있게 고려하여, 1차 단계평가 결과 공개와 같은 수준으로 2차 단계평가 결과를 공개했다"고 말했다.