Cjournal
Cjournal
기업과산업  전자·전기·정보통신

한글과컴퓨터, PDF 추출 핵심 기술 글로벌 오픈소스로 공개

조승리 기자 csr@businesspost.co.kr 2025-09-17 09:57:22
확대 축소
공유하기
페이스북 공유하기 X 공유하기 네이버 공유하기 카카오톡 공유하기 유튜브 공유하기 url 공유하기 인쇄하기

[비즈니스포스트] 한글과컴퓨터는 AI 학습과 활용 과정에서 난제로 지적돼 온 PDF 문서 데이터 처리 병목 현상을 해소할 핵심 기술을 글로벌 오픈소스로 공개했다고 17일 밝혔다. 

이번에 공개된 ‘오픈데이터로더 PDF’는 한컴이 축적한 문서 처리 기술력을 바탕으로 개발한 PDF 데이터 추출 엔진이다.
 
한글과컴퓨터, PDF 추출 핵심 기술 글로벌 오픈소스로 공개
▲ 17일 한글과컴퓨터는 PDF 추출 핵심 기술을 글로벌 오픈소스로 공개했다고 밝혔다. <한글과컴퓨터>

PDF는 세계적으로 AI 학습에 가장 널리 사용되는 문서 포맷이지만, 복잡한 내부 구조 때문에 학습용 데이터 추출이 쉽지 않아 AI 개발 과정에서 큰 제약이 따랐다.

이번 프로젝트는 이러한 문제를 해결하기 위해 한컴이 PDF 기술 전문회사 듀얼랩과 오픈소스 기반 PDF 데이터로더를 공동 개발했다.

공동 개발한 오픈데이터로더 PDF는 PDF 문서 내 텍스트, 표, 이미지, 레이아웃 정보를 높은 정확도와 빠른 성능으로 추출해, AI 학습에 즉시 활용할 수 있는 정형화된 데이터로 변환한다.

벤치마크 테스트 결과, 사람의 읽기 순서를 측정하는 지표인 NID에서 다른 기술 대비 85%라는 높은 수치를 기록했다고 회사 측은 설명했다.

금융·공공기관 등 민감한 데이터를 다루는 환경에서도 네트워크 연결 없이 완전 오프라인으로 작동해, 데이터 유출과 외부 업로드로 인한 정보 노출 위험을 원천 차단한다.

한컴은 오픈데이터로더 PDF에 악의적 콘텐츠 삽입을 통한 프롬프트 인젝션 등 보안 위협을 자동 감지·차단하는 기능을 추가로 제공한다.

한컴은 AI 생태계 전반의 오픈소스 확산과 기술 고도화를 추진하기 위해 챗GPT, 제미나이, 랭체인 등 주요 AI 프레임워크와의 연동·호환성을 강화하고, 깃허브를 통한 글로벌 개발자 커뮤니티와의 협력을 이어간다. 조승리 기자

최신기사

미국 '핵융합 발전' 업계에 빅테크 자금 몰린다, AI 전력 수요에 해법으로 주목
아이폰17 혹평에도 판매 흥행 조짐, LG디스플레이·LG이노텍 하반기 실적 개선 전망
현대차·기아, 공장 생산 로봇에 와이파이·5G 동시 처리하는 단말기 적용
SMIC 중국산 노광 장비로 'ASML 의존 낮추기' 총력, AI 반도체 생산 목표
국제연구진 "서울 기온 1990년대보다 1.9도 높아져, 올해 여름 가장 더웠다"
서울시 '우이신설 연장선' 사업 본격화, HL디앤아이한라와 공사계약 맺어
비트코인 시세 4분기 급등 가능성, 가격 변동성 하락은 "폭발적 상승 동력"
"중국 희토류 독점에 균열", 트럼프 공급망 확대 정책에 한국 제이에스링크도 참여 
국회 과방위 24일 통신사 해킹 청문회, KT 소액결제 피해·LG유플러스 해킹 의혹 다뤄
자녀의 '대치동 유학' 고민하는 학부모를 위한 도서, '대치동 학원의 비밀' 출간
Cjournal

댓글 (0)

  • - 200자까지 쓰실 수 있습니다. (현재 0 byte / 최대 400byte)
  • - 저작권 등 다른 사람의 권리를 침해하거나 명예를 훼손하는 댓글은 관련 법률에 의해 제재를 받을 수 있습니다.
  • - 타인에게 불쾌감을 주는 욕설 등 비하하는 단어가 내용에 포함되거나 인신공격성 글은 관리자의 판단에 의해 삭제 합니다.