한글과컴퓨터, PDF 추출 핵심 기술 글로벌 오픈소스로 공개

기업과산업 전자·전기·정보통신

한글과컴퓨터, PDF 추출 핵심 기술 글로벌 오픈소스로 공개

조승리 기자 csr@businesspost.co.kr 2025-09-17 09:57:22

확대 축소

[비즈니스포스트] 한글과컴퓨터는 AI 학습과 활용 과정에서 난제로 지적돼 온 PDF 문서 데이터 처리 병목 현상을 해소할 핵심 기술을 글로벌 오픈소스로 공개했다고 17일 밝혔다.

이번에 공개된 ‘오픈데이터로더 PDF’는 한컴이 축적한 문서 처리 기술력을 바탕으로 개발한 PDF 데이터 추출 엔진이다.

한글과컴퓨터, PDF 추출 핵심 기술 글로벌 오픈소스로 공개 — ▲ 17일 한글과컴퓨터는 PDF 추출 핵심 기술을 글로벌 오픈소스로 공개했다고 밝혔다. <한글과컴퓨터>

PDF는 세계적으로 AI 학습에 가장 널리 사용되는 문서 포맷이지만, 복잡한 내부 구조 때문에 학습용 데이터 추출이 쉽지 않아 AI 개발 과정에서 큰 제약이 따랐다.

이번 프로젝트는 이러한 문제를 해결하기 위해 한컴이 PDF 기술 전문회사 듀얼랩과 오픈소스 기반 PDF 데이터로더를 공동 개발했다.

공동 개발한 오픈데이터로더 PDF는 PDF 문서 내 텍스트, 표, 이미지, 레이아웃 정보를 높은 정확도와 빠른 성능으로 추출해, AI 학습에 즉시 활용할 수 있는 정형화된 데이터로 변환한다.

벤치마크 테스트 결과, 사람의 읽기 순서를 측정하는 지표인 NID에서 다른 기술 대비 85%라는 높은 수치를 기록했다고 회사 측은 설명했다.

금융·공공기관 등 민감한 데이터를 다루는 환경에서도 네트워크 연결 없이 완전 오프라인으로 작동해, 데이터 유출과 외부 업로드로 인한 정보 노출 위험을 원천 차단한다.

한컴은 오픈데이터로더 PDF에 악의적 콘텐츠 삽입을 통한 프롬프트 인젝션 등 보안 위협을 자동 감지·차단하는 기능을 추가로 제공한다.

한컴은 AI 생태계 전반의 오픈소스 확산과 기술 고도화를 추진하기 위해 챗GPT, 제미나이, 랭체인 등 주요 AI 프레임워크와의 연동·호환성을 강화하고, 깃허브를 통한 글로벌 개발자 커뮤니티와의 협력을 이어간다. 조승리 기자

조승리 기자의 다른기사보기

씨저널 C스토리

'배송 강자' 쿠팡을 배송으로 잡겠단 최수연 : 최근 네이버 커머스 성공은 반짝 '탈팡' 효과가 아니라 했다

KB금융 양종희식 '효율 경영' 압도적 지표들로 증명 : 원칙은 단순명쾌 '덜 쓴다, 주주에게 더 준다'

코스메카코리아 조임래·박은희 부부 사내이사 임기 만료가 주목 받는 이유 : 코스피행 좌절시킨 지배구조 핵이라서

많이 본 기사

1	"현대차 시총에 보스턴다이나믹스 비중 25%" 외신 분석, 로봇 관련주로 주목
2	삼성전자 갤럭시S26 최대 30만 원 인상 가닥, 노태문 올해 스마트폰 역성장 고심 깊..
3	영화 '만약에 우리' 4주 연속 1위, OTT '판사 이한영' 1위 등극
4	'현대차·포스코퓨처엠 협력' 팩토리얼, 미국 승용차에 반고체 배터리 첫 공급
5	포스코그룹 회장 장인화 "LNG 중심 에너지 사업 확대" "AI 전환 서두르자"