국산 인공지능(AI) 반도체의 성능을 평가하기 위해 만든 공동지표 'K-Perf'가 처음으로 공공기관의 실제 반도체 도입 검증 과정에 활용된다. 한국전력은 리벨리온의 국산 신경망처리장치(NPU)를 변전소 AI 영상분석 업무에 시범 적용하고, 한국정보통신기술협회(TTA)는 전력현장 운영환경을 반영해 성능과 신뢰성을 검증한다. 지난해 말 만들어진 K-Perf가 생성형 AI 서비스 시험을 거쳐 실제 산업현장의 도입 판단을 지원하는 단계로 적용 범위를 넓힌 것이다.
과학기술정보통신부는 10월 2일 경기 성남 리벨리온 본사에서 한국전력·리벨리온·TTA가 '국산 NPU 기반 전력분야 AI 영상분석 기술협력' 업무협약을 체결했다고 밝혔다. 협약에 따라 한전은 전력현장 시범운영과 활용모델 개발을 맡고, 리벨리온은 NPU 성능 최적화와 기술지원을 담당한다. TTA는 실제 전력현장의 운영조건을 반영해 NPU의 성능과 신뢰성을 검증한다.
이번 사업은 국산 AI 반도체가 공공기관에 처음 사용되는 사례라는 의미는 아니다. 정부 발표에서 처음인 것은 K-Perf가 공공기관의 AI 반도체 도입 과정에서 실제 검증 수단으로 사용되는 것이다. 따라서 이번 단계는 한전이 리벨리온 NPU를 대규모로 정식 구매하거나 상용운영을 확정한 단계가 아니라, 실제 전력현장에서 성능과 안정성, 운영효과를 확인하는 실증 단계로 구분해야 한다.

변전소별 분산 AI 분석, NPU 기반 통합관제로 실증
한전은 현재 변전소별로 분산 운영하는 AI 영상분석 인프라를 NPU 기반의 통합 관제 시스템으로 구성해 실증할 예정이다. 변전소 CCTV 영상분석 업무를 국산 NPU에서 처리하면서 실제 현장 성능과 운영 효율을 확인하는 방식이다. 일부 공개자료에서는 기존 변전소별 GPU 기반 분산처리 구조를 지역 관제센터 중심의 NPU 통합 방식으로 바꾸는 형태로 설명하고 있다.
검증 범위는 단순한 AI 칩의 연산속도에 머물지 않는다. 정부와 한전은 실제 운영환경에서 성능과 신뢰성을 확인하고, 시스템 운영 효율과 비용 절감 효과도 함께 검증할 계획이다. 다만 현재 공개된 자료에는 카메라 수와 영상 해상도, 초당 프레임 수, 적용 AI 모델, 기존 GPU 사양, NPU 서버 수량이나 구체적인 비용 절감 목표치는 제시되지 않았다. 비용 절감 역시 이번 실증에서 확인할 항목이지 이미 달성된 결과는 아니다.
이번 협약 자료에는 리벨리온이 NPU 공급과 최적화를 맡는다는 사실은 공개됐지만 실제 한전 실증에 투입되는 칩의 구체적인 모델명은 확인되지 않는다. 앞선 K-Perf 시험에서 사용된 리벨리온 제품은 '리벨100'이었지만 이를 근거로 이번 전력현장 실증에도 같은 제품이 투입된다고 단정할 수는 없다.
지난해 만든 K-Perf, 6월에는 생성형 AI 서비스로 첫 시험
K-Perf는 국산 NPU의 실제 도입 판단에 필요한 성능자료를 제공하기 위해 지난해 12월 마련됐다. 과기정통부는 당시 AI 반도체 공급기업뿐 아니라 클라우드·통신·시스템통합·AI 서비스 기업과 TTA·IITP·NIPA 등 관계기관이 참여하는 K-Perf 협의체를 출범시켰다. 협의체에는 모두 15개 수요·공급·관계기관이 참여해 서비스별 성능측정 모델과 조건, 지표를 마련했다.
K-Perf의 첫 본격적인 시험은 올해 상반기에 진행됐다. 과기정통부와 TTA, 정보통신기획평가원(IITP)은 퓨리오사AI의 '레니게이드(RNGD)'와 리벨리온의 '리벨100'을 대상으로 AI 챗봇, 문서 검색, 보고서 생성, 대용량 문서 분석 등의 서비스 유형별 검증을 수행했다.
정부가 6월 공개한 결과에 따르면 두 제품은 각각 시험한 서비스에서 수요기업이 요구한 서비스별 성능기준을 충족했다. 다만 정부는 두 반도체의 세부 점수나 제품 간 순위, NVIDIA GPU 등 해외 제품과의 직접 비교 결과는 공개하지 않았다. 따라서 이 시험결과만으로 국산 NPU가 특정 해외 GPU보다 빠르거나 전력효율이 높다고 판단할 수 있는 자료는 현재 공개돼 있지 않다.
당시 정부는 K-Perf의 적용범위를 온디바이스 AI 반도체까지 넓히고 시험체계를 고도화하는 한편 민간·공공 분야에서 활용을 확대하겠다고 밝혔다. 이번 한전 실증은 그 계획이 실제 공공기관 업무환경으로 이어진 사례다.
K-Perf는 칩의 최고 연산성능보다 실제 서비스 조건에 초점
K-Perf의 특징은 반도체가 낼 수 있는 최대 연산량 하나만 비교하는 방식과 다르다는 데 있다. 정부는 K-Perf를 만들면서 실제 NPU를 이용할 수요기업이 사용하는 서비스 형태를 반영해 측정 모델과 시험조건, 평가 지표를 세분화했다고 설명했다.
AI 반도체를 실제 서비스에 적용할 때는 최대 연산성능 외에도 사용 모델, 동시 처리량, 응답시간, 소프트웨어 최적화와 서비스 유형 등에 따라 체감 성능이 달라진다. K-Perf는 이런 실제 사용조건에서 국산 NPU가 수요기업이 정한 서비스 수준을 충족하는지를 검증하는 방향으로 마련됐다. 올해 6월 챗봇·문서검색 등의 생성형 AI 업무를 평가한 데 이어 이번에는 전력설비 영상분석이라는 다른 형태의 실제 업무로 검증 범위가 확대됐다.
그러나 현재 공개된 자료만으로 K-Perf의 모든 세부 측정항목을 확인할 수 있는 것은 아니다. 생성형 AI 추론에서 통상 사용되는 첫 토큰 생성시간(TTFT), 출력 토큰 처리시간, 초당 처리량, 동시 사용자 수, 전력소비량 등을 K-Perf가 각각 어떤 조건과 기준값으로 평가하는지는 공개된 정부 보도자료에 구체적으로 제시돼 있지 않다.
이 때문에 현재 K-Perf를 국제 AI 반도체 성능 순위표처럼 해석하기는 어렵다. 공개된 결과 역시 특정 NPU가 서비스별 요구수준을 충족했는지를 중심으로 제시돼 있다.
MLPerf도 RAG·에이전트까지…해외 벤치마크도 실제 서비스 반영 확대
해외의 AI 시스템 성능평가도 실제 서비스 형태를 평가에 포함하는 방향으로 범위를 넓히고 있다.
국제 AI 성능 벤치마크를 운영하는 MLCommons는 지난 9월 MLPerf Inference v6.1 결과를 공개했다. 이번 평가에는 역대 가장 많은 30개 기관이 참여해 120개 시스템을 제출했으며 데이터센터용 10개, 엣지용 6개 벤치마크가 운영됐다.
특히 v6.1에는 검색증강생성(RAG) 전체 파이프라인과 에이전트형 엣지 AI를 평가하는 새로운 시험이 추가됐다.
RAG 시험은 질문을 임베딩으로 변환한 뒤 벡터 데이터베이스에서 문서를 검색하고, 결과를 재정렬한 뒤 LLM이 답변하는 전체 과정을 대상으로 한다. 단일 모델의 추론속도만 측정하지 않고 실제 AI 서비스에서 여러 구성요소가 연결돼 작동하는 과정 전체를 평가한다. 엣지 에이전트 시험도 단일 질문과 답변이 아니라 대화내용이 계속 누적되고 도구호출과 추론이 반복되는 멀티턴 작업을 측정한다.
MLCommons는 MLPerf를 시스템 아키텍처와 관계없이 대표적인 AI 워크로드를 재현 가능한 방식으로 측정해 AI 시스템을 구매·배치하려는 고객에게 비교 가능한 성능자료를 제공하는 체계라고 설명하고 있다.
올해 7월에는 이보다 구매자 관점을 더 강화한 'MLPerf Endpoints' v0.7도 공개했다. 이 체계는 실제 배치된 AI 모델과 하드웨어·소프트웨어 조합이 부하 상황에서 얼마나 잘 서비스를 제공하는지 측정한다. 현재 주요 평가 차원에는 전체 처리량과 상호작용성, 첫 토큰 응답시간의 95백분위 값, 동시접속 수가 포함된다.
MLCommons는 Endpoints를 AI 인프라 구매자가 서로 다른 클라우드와 하드웨어, 관리형 서비스를 비교하는 데 활용할 수 있도록 개발하고 있으며 향후 지속적으로 결과를 제출하는 방식과 에이전트형 워크로드 등을 확대할 계획이라고 밝혔다.
K-Perf와 MLPerf는 목적과 공개방식 달라
K-Perf와 MLPerf 모두 실제 AI 서비스 환경을 성능평가에 더 많이 반영한다는 공통점이 있지만 두 체계를 동일한 종류의 벤치마크로 볼 수는 없다.
MLPerf는 여러 기업과 시스템이 동일하거나 표준화된 조건에 결과를 제출하고 검토받아 서로 비교할 수 있도록 하는 국제 벤치마크다. MLPerf Inference의 Closed 부문은 동일 조건에서 시스템을 비교할 수 있도록 구성돼 있고 제출 결과와 시험방법도 공개된다.
반면 현재 공개된 K-Perf 자료는 국내 NPU를 실제로 사용할 수요기업의 서비스 조건과 성능 요구수준을 반영하고, 해당 NPU가 도입에 필요한 기준을 충족하는지 검증하는 데 초점을 두고 있다. 공개된 K-Perf 결과도 전체 제품을 하나의 순위로 배열하기보다 서비스별 요구수준 충족 여부를 중심으로 제시돼 있다.
따라서 K-Perf를 단순히 '한국판 MLPerf'라고 표현하거나 두 지표의 점수를 직접 비교할 근거는 현재 공개돼 있지 않다.
공공 실증 결과가 다음 판단자료
이번 한전 실증에서 확인할 대상은 실제 전력현장 영상분석을 국산 NPU로 처리했을 때의 성능과 신뢰성, 운영효과다.
한전은 전력현장 시범운영과 활용모델 개발을 담당하고 리벨리온은 NPU 최적화를 지원한다. TTA가 현장 운영환경을 반영해 K-Perf 기반 검증을 수행한다. 검증 결과를 토대로 국산 AI 반도체의 전력 분야 적용 확대 여부가 검토된다.
현재 단계에서 공개된 것은 실증계획과 역할분담이다. 실제 처리성능과 기존 시스템 대비 비용, 전력효율, 안정성, 실증 규모와 최종 도입 여부는 아직 결과가 발표되지 않았다.
K-Perf는 지난해 말 지표를 마련한 뒤 올해 6월 생성형 AI 서비스에서 국산 NPU가 수요기업의 성능기준을 충족하는지 시험했고, 이번에는 실제 전력현장에서 공공기관의 반도체 도입 판단을 지원하는 검증수단으로 사용된다. 국산 AI 반도체의 성능을 시험환경에서 확인하는 단계에서 실제 운영조건에서 검증하는 단계로 적용범위가 넓어진 셈이다.
출처: 과학기술정보통신부 「국산 AI반도체 성능지표 K-Perf 공공 현장 도입 검증 첫 활용」(2026.10.2) · 한국전력 「국산 NPU 기반 전력 분야 AI 영상분석 기술협력」(2026.10.2) · 과학기술정보통신부·TTA·IITP 「2026 K-AI반도체 성장 포럼/K-Perf 시험결과」(2026.6.4) · 과학기술정보통신부 「K-Perf 협의체 출범」(2025.12.10) · MLCommons 「MLPerf Inference v6.1 Results」(2026.9.16) · MLCommons 「MLPerf Endpoints v0.7」(2026.7.28)




















댓글
0