국제 기준 벤치마크·독자성 지표로 평가 체계 강화
에이전트 업무 수행력과 산업 현장 실증 핵심 변수
LG·SKT·업스테이지·모티프 중 3개 팀만 생존
‘국가대표 인공지능(AI)’을 가리는 독자 AI 파운데이션 모델(독파모) 프로젝트가 오는 8월 2차 평가에 돌입한다. 이번 평가는 단순한 벤치마크 점수보다 실제 산업 현장에서 활용 가능한지를 가리는 데 초점이 맞춰질 전망이다. 특히 이번 평가로 4개 팀 중 1곳이 탈락하는 만큼, 1차 관문을 통과한 LG AI연구원·SK텔레콤·업스테이지·모티프테크놀로지스 등이 막판 치열에 나설 것으로 보인다.
30일 본지 취재결과, 독자 AI 파운데이션 모델 1차 관문을 통과한 LG AI연구원과 SK텔레콤, 업스테이지는 지난달 말 2차 평가용 모델 개발을 마쳤고, 후발주자인 모티프테크놀로지스도 조만간 제출을 완료할 예정이다.
과학기술정보통신부와 정보통신산업진흥원(NIPA)은 내달 4일까지 국민 평가단 200명을 모집, 8~11일 네 팀의 모델을 직접 사용한 뒤 점수를 매길 방침이다. 결과는 다음달 중 공개된다.
평가 체계는 1차 테스트와 같은 벤치마크·전문가 심사·사용자 평가 3축을 유지하지만 세부 내용은 손질됐다.
벤치마크는 글로벌 주요 리더보드를 겨냥한 국제 기준 항목으로 재편되고, 전문가 평가에는 ‘프롬 스크래치(From Scratch·처음부터 자체 개발)’ 원칙의 이행 수준을 단계별로 차등 평가하는 독자성 세부 지표가 새로 들어갔다. 해외 오픈소스 모델을 개량한 수준인지, 구조부터 직접 설계 했는지를 가려내겠다는 취지다. 여기에 도구 활용과 자율 수행 능력이 AI 경쟁력의 핵심으로 부상한 만큼, 에이전트 역량과 산업 적용성, 사업화 가능성의 비중이 커질 것이란 관측이다.
1차 평가에서 가장 높은 평가를 받은 LG AI연구원은 산업 전문성으로 2차 평가에서도 수위 자리를 지키겠다는 구상이다. 제조·화학·배터리·금융·바이오 등 LG그룹내 주요 계열사와 파트너사 현장에서 축적한 데이터를 실증에 곧바로 투입할 수 있다는 점이 최대 강점이다.
특히 표와 그래프, 도면, 전문 기호가 섞인 산업 문서 이해 능력도 차별화 요소로 꼽힌다. 포털 줌(ZUM)의 AI 검색 모델로 적용된 데 이어 통신·공공안전·경찰 수사 지원으로 영역을 넓혔고, 지난 7일에는 코스콤과 업무협약을 맺어 국내 상장기업 2500여 종목의 한 달 주가 예측·해설을 제공하기로 했다. 정부가 추진하는 ‘모두의 AI’에도 LG유플러스와 함께 참여한다.
SK텔레콤은 오픈소스 플랫폼 허깅페이스에 파라미터 6880억개 규모의 ‘A.X K2’를 공개했다.
519B 규모였던 전작 ‘A.X K1’보다 모델을 키워 수학·과학 추론과 한국 지식·장문 추론 성능을 끌어올렸다. 국내외 14개 벤치마크 평균 성능은 32.2%포인트, 에이전트 관련 평가 성능은 83.9%포인트 높였다. 실증도 제조 현장에 집중된다. 올 하반기 KG스틸 당진공장 냉간 압연 라인과 자동차 부품 기업 코넥의 주조·가공 공정에 제조 특화 AI 에이전트 데모 버전을 투입하고, 암 표적 치료제 개발 등 바이오·국방 분야로도 활용 범위를 넓힌다. 특히 컨소시엄에 SK AX와 테크노매트릭스가 추가로 합류했으며, 리벨리온의 신경망처리장치(NPU) 서버 한 대로 대형 모델을 구동하는 시연도 마쳤다.
업스테이지는 에이전트 업무에 최적화한 ‘솔라 오픈2’로 승부수를 던졌다.
전체 파라미터 2500억개 중 작업에 필요한 150억개만 활성화하는 전문가혼합(MoE) 구조를 채택, 양자화 하면 엔비디아 H200 그래픽처리장치(GPU) 2장으로도 구동된다. 도입 비용 부담을 낮춰 기업·공공기관의 진입 장벽을 걷어내겠다는 계산이다. 회사는 지시 이행과 도구 호출 평가에서 딥시크·미스트랄 등 주요 해외 오픈 모델을 앞섰다고 강조했다. 활용처로는 포털 다음의 검색·요약·대화형 에이전트 서비스와 플랫폼 타임리를 통한 지자체·공공기관 도입을 제시했고, 컨소시엄 참여사 노타와는 전용 경량화 모델도 내놨다.
지난 2월 재공모로 경쟁에 합류한 모티프테크놀로지스는 3140억개 파라미터 규모의 ‘모티프3’ 프리뷰로 추격 중이다.
글로벌 AI 평가기관 아티피셜애널리시스의 종합 성능지표(AAII)에서 44점을 받아 중국 딥시크 최신 모델 ‘V4 프로’와 동점을 기록하며 오픈소스 모델 3위권에 올랐다. 추론 시에는 전체의 약 4%인 130억개만 활성화해 연산 효율을 높였다. 해외 모델 개량이 아닌 독자 아키텍처 기반이라는 점, 기존 3개 팀보다 짧은 기간에 모델을 내놨다는 점은 강점이지만 산업 현장 성과 입증은 숙제로 남아 있다. 우선 컨소시엄에 참여한 삼일회계법인 등을 중심으로 모델 공급에 나설 예정이다.
한편, 이번에 2차 평가를 통과한 3개 팀은 다시 고도화 과정을 거쳐 연말 최종 2개 팀을 가리는 마지막 관문을 치른다. 정부가 오는 12월 ‘모두의 AI’ 출시를 예고한 만큼, 최종 관문을 통과한 국산 AI 모델이 실제 대국민 서비스에 얼마나 안착하는지가 중요 관전 포인트가 될 전망이다.
[CEO스코어데일리 / 김동일 기자 / same91@ceoscore.co.kr]








![[그래픽] 바디프랜드 실적 추이](https://www.ceoscoredaily.com/photos/2026/09/09/2026090911141740465_m.jpg)
























































































![[26-07호] 100대기업 경제기여액 현황](https://www.ceoscoredaily.com/photos/2026/08/25/2026082509075151364_m.png)





![[이달의 주식부호] 코스피 횡보에도 주식부호 자산 14조 껑충… GS·한화 오너가 약진](https://www.ceoscoredaily.com/photos/2026/09/02/2026090211000540192_m.jpg)

댓글
[ 300자 이내 / 현재: 0자 ]
현재 총 0개의 댓글이 있습니다.