Cjournal
Cjournal
기업과산업  전자·전기·정보통신

한글과컴퓨터, PDF 추출 핵심 기술 글로벌 오픈소스로 공개

조승리 기자 csr@businesspost.co.kr 2025-09-17 09:57:22
확대 축소
공유하기
페이스북 공유하기 X 공유하기 네이버 공유하기 카카오톡 공유하기 유튜브 공유하기 url 공유하기 인쇄하기

[비즈니스포스트] 한글과컴퓨터는 AI 학습과 활용 과정에서 난제로 지적돼 온 PDF 문서 데이터 처리 병목 현상을 해소할 핵심 기술을 글로벌 오픈소스로 공개했다고 17일 밝혔다. 

이번에 공개된 ‘오픈데이터로더 PDF’는 한컴이 축적한 문서 처리 기술력을 바탕으로 개발한 PDF 데이터 추출 엔진이다.
 
한글과컴퓨터, PDF 추출 핵심 기술 글로벌 오픈소스로 공개
▲ 17일 한글과컴퓨터는 PDF 추출 핵심 기술을 글로벌 오픈소스로 공개했다고 밝혔다. <한글과컴퓨터>

PDF는 세계적으로 AI 학습에 가장 널리 사용되는 문서 포맷이지만, 복잡한 내부 구조 때문에 학습용 데이터 추출이 쉽지 않아 AI 개발 과정에서 큰 제약이 따랐다.

이번 프로젝트는 이러한 문제를 해결하기 위해 한컴이 PDF 기술 전문회사 듀얼랩과 오픈소스 기반 PDF 데이터로더를 공동 개발했다.

공동 개발한 오픈데이터로더 PDF는 PDF 문서 내 텍스트, 표, 이미지, 레이아웃 정보를 높은 정확도와 빠른 성능으로 추출해, AI 학습에 즉시 활용할 수 있는 정형화된 데이터로 변환한다.

벤치마크 테스트 결과, 사람의 읽기 순서를 측정하는 지표인 NID에서 다른 기술 대비 85%라는 높은 수치를 기록했다고 회사 측은 설명했다.

금융·공공기관 등 민감한 데이터를 다루는 환경에서도 네트워크 연결 없이 완전 오프라인으로 작동해, 데이터 유출과 외부 업로드로 인한 정보 노출 위험을 원천 차단한다.

한컴은 오픈데이터로더 PDF에 악의적 콘텐츠 삽입을 통한 프롬프트 인젝션 등 보안 위협을 자동 감지·차단하는 기능을 추가로 제공한다.

한컴은 AI 생태계 전반의 오픈소스 확산과 기술 고도화를 추진하기 위해 챗GPT, 제미나이, 랭체인 등 주요 AI 프레임워크와의 연동·호환성을 강화하고, 깃허브를 통한 글로벌 개발자 커뮤니티와의 협력을 이어간다. 조승리 기자

최신기사

LG 연말 '사랑의열매' 이웃사랑성금 120억 기부, 26년 누적성금 2500억
LG전자 일본 사물인터넷 기업과 파트너십, 현지 식음료 매장에 키오스크 공급
HD현대중공업 페루 해군과 차세대 잠수함 개발협약 체결, "중남미시장 확대"
신한은행 비대면 전용 '신속한 전문직 사업자대출' 출시, 최대 1억 한도
현대차 유엔 산하 기구에 아이오닉5와 충전 인프라 기증, 세계구호 현장 투입
SK넥실리스 배터리업계 최초 '카퍼마크' 획득, 글로벌 고객사 ESG 요구 대응
삼성전자 제미나이 탑재한 '비스포크 AI 냉장고' 공개, 식료품 라벨 자동 인식
머스크 재산 사상 최초 7천억 달러 돌파, 2위와 격차는 5천억 달러
정용진 신세계 회장 미국 정재계 주요 인사 면담, 트럼프 주니어와 사업 논의
삼성전자 페루에 첫 냉난방공조 교육센터 설립, 중남미 전문인력 양성 확대
Cjournal

댓글 (0)

  • - 200자까지 쓰실 수 있습니다. (현재 0 byte / 최대 400byte)
  • - 저작권 등 다른 사람의 권리를 침해하거나 명예를 훼손하는 댓글은 관련 법률에 의해 제재를 받을 수 있습니다.
  • - 타인에게 불쾌감을 주는 욕설 등 비하하는 단어가 내용에 포함되거나 인신공격성 글은 관리자의 판단에 의해 삭제 합니다.