QueryPie, NIPA 첨단 GPU 지원사업 성과로 DLP 모델 공개·UEBA 연구 구체화
2026년 9월 19일

NIPA 주관 첨단 GPU 지원사업 성과… 다국어 DLP 모델 공개·UEBA 연구 구체화
QueryPie가 한국정보통신산업진흥원(NIPA)이 주관한 첨단 GPU 지원사업의 연산 자원을 활용해 학습한 다국어 DLP(Data Loss Prevention) AI 모델을 Hugging Face에 공개했다. 한국어·영어·일본어의 민감정보 데이터를 정제·확장하고, 여러 모델을 반복 학습·비교해 기업의 AI 활용 환경에 필요한 탐지 기술을 구체화한 성과다.
최근 국내 기업 보안 담당자들과의 논의에서 공통적으로 확인된 과제는 DLP와 UEBA였다. AI 에이전트와 MCP 기반 도구의 활용이 늘면서 외부 AI로 전달되는 데이터에서 민감정보를 찾아 보호하는 일과, 빠르게 늘어나는 활동 로그에서 평소와 다른 행동을 선별하는 일이 동시에 중요해졌다. 현장에서는 어떤 데이터를 보호할지 식별하는 DLP와 어떤 행동을 먼저 살펴볼지 판단하는 UEBA를 함께 강화해야 한다는 요구가 뚜렷했다.
DLP에서는 업무 문서, 대화, 코드, AI 프롬프트에 섞인 민감정보를 문맥 속에서 찾아야 하고, UEBA에서는 빠르게 늘어나는 활동 로그를 시간의 흐름과 업무 맥락에 따라 해석해야 한다. 두 과제 모두 모든 입력을 대형 AI 모델로 분석하면 연산 비용과 상시 GPU 인프라가 부담이 된다. 자체 GPU를 갖추기 어려운 기업도 사용할 수 있도록, 많은 입력을 가볍게 선별하고 필요한 대상만 정밀 분석하는 구조가 필요하다.
QueryPie는 이 문제를 SLM 기반의 데이터 보호를 위한 DLP와 행동 위험 탐지를 위한 UEBA라는 두 연구·개발 축으로 구체화하고 있다.
민감정보를 빠르게 선별하고 정확한 문구까지 찾는 DLP
DLP의 앞단에서는 정규식 검사와 ELECTRA 기반 경량 모델이 대량의 입력에서 민감정보 위험을 빠르게 선별한다. CPU 환경에서도 활용할 수 있는 한국어 경량 모델은 내부 평가에서 정확도 약 92%, 재현율 약 97%, F1 약 94%를 기록했고 평균 응답 시간은 약 17.3ms였다. 한국어뿐 아니라 영어와 일본어 모델도 학습·평가해 다국어 업무 환경에 대응하는 기반을 마련했다.
Gemma 계열 12B 정밀 소형언어모델(SLM)은 민감정보의 유형과 원문 속 해당 문구를 추출한다. 모델이 찾아낸 문구의 위치는 별도 프로그램이 원문과 대조해 계산하도록 역할을 나눴다. NIPA 지원 GPU로 다국어 데이터 학습과 후보 모델 비교를 수행한 결과, 정밀 모델은 내부 종합 평가에서 92.64점으로 가장 높은 결과를 기록했다.
기업 현장에서는 외부 AI에 민감한 원문을 그대로 전달하지 않으면서 정보 사이의 관계와 업무 맥락은 유지하고 싶다는 동적 DLP 수요도 확인됐다. QueryPie는 정밀 SLM이 민감정보의 유형과 원문 문구를 찾고, 프로그램이 해당 문구의 정확한 위치를 계산한 결과를 기업별 보호 정책과 연결하는 방향으로 발전시켜 나갈 계획이다. 동적 DLP 로드맵에는 외부 전송 차단, 화면 내 민감정보 강조·마스킹, 사용자 경고와 관리자 검토, 보안 시스템 알림 등 위험도와 정책에 따른 후속 조치가 포함된다.
흩어진 로그를 행동의 흐름으로 판단하는 UEBA
AI 에이전트와 MCP 기반 도구가 감사 대상에 포함되면서 기업이 확인해야 할 로그는 크게 늘어난다. 고객사 논의에서도 모든 기록을 사람이 직접 읽거나 범용 AI에 전달하는 방식 대신, 중요한 행동을 먼저 선별해 보안 담당자가 확인할 수 있게 해달라는 요구가 강했다.
QueryPie가 연구·개발 중인 UEBA(User and Entity Behavior Analytics)는 개별 로그 한 줄보다 사용자와 단말의 활동을 시간순으로 묶어 판단하는 데 초점을 맞춘다. 접속 시간과 위치, 접근 대상, 데이터 사용량처럼 각각은 평범해 보이는 기록을 함께 분석하고, 업무 맥락과 연속된 사건을 바탕으로 위험도와 판단 근거를 제시하는 모델 구조를 개발하고 있다.
UEBA 역시 모든 로그를 고비용 범용 모델에 맡기지 않고 중요한 신호를 먼저 좁히는 구조를 지향한다. 고객사마다 다른 로그 형식과 보안 기준을 반영할 수 있도록 입력 형식을 표준화하고 조직별 업무 시간·접근 정책 같은 맥락을 판단에 결합하는 방식을 연구하고 있다. 경량 SLM을 중심으로 추론 비용을 낮춰 CPU 중심의 기업 환경에서도 활용 범위를 넓히는 것이 목표다.
QueryPie는 NIPA 주관 첨단 GPU 지원사업을 통한 다국어 DLP 모델 학습·공개 성과를 바탕으로, 기업 현장에서 필요성이 확인된 UEBA 연구·개발도 구체화하며 AI 활용 과정의 데이터와 행동을 함께 살피는 기술 기반을 넓혀가고 있다.
모델 및 다운로드 안내
- QueryPie Hugging Face: https://huggingface.co/querypieai
- How to Download from Hugging Face: https://youtu.be/uNi4kYGPPUA
