GitHub 오픈소스 해설

AI 및 에이전트Python

docling-project/docling

문서를 AI 입력으로 바꾸는 Docling

PDF와 오피스 문서, 이미지, 음성과 영상의 구조를 분석해 Markdown, JSON과 생성형 AI용 입력으로 변환하는 로컬 실행 도구

GitHub 저장소 보기

README 편집 요약

프로젝트 핵심 읽기

README 원문 보기

한눈에 보기

PDF와 오피스 문서, 이미지, 음성과 영상을 구조화된 문서 표현으로 분석해 생성형 AI 파이프라인에 연결하는 로컬 실행 도구입니다.
docling 프로젝트를 설명하는 README 대표 이미지
docling-project/docling 저장소의 README에서 사용하는 프로젝트 이미지이미지 원본 보기

프로젝트 설명

  • 핵심 기능

    서로 다른 문서를 공통 구조로 변환한다

    레이아웃, 읽기 순서, 표, 수식과 OCR을 해석하고 Markdown, HTML, WebVTT, DocLang과 손실 없는 JSON으로 내보냅니다.

  • 구성과 특징

    CLI와 Python API, MCP 및 서버를 제공한다

    로컬 변환기를 직접 호출하거나 LangChain과 LlamaIndex 통합, MCP 서버, 별도 docling-serve API로 애플리케이션에 연결합니다.

  • 사용 전 확인

    형식별 모델 자원과 Python 버전을 확인한다

    Python 3.10 이상이 필요하며 OCR, 비전 언어 모델, 음성 및 영상 처리는 다운로드와 연산량이 달라 민감 문서의 로컬 실행 조건도 따로 시험해야 합니다.

  • 차별점

    단순 텍스트 추출보다 문서 구조 보존에 집중한다

    표와 페이지 레이아웃을 포함한 통합 DoclingDocument를 만들어 검색, RAG와 후속 변환에서 원문 관계를 유지합니다.

GitHub 관심도

Star 순위 기록

프로젝트 품질 평가와 별개로, 누적 Star 기준 Top 100에서 나타난 관심도 변화만 기록합니다.

1개 스냅샷현재 순위 밖

아직 비교할 날짜가 없습니다. 다음 스냅샷부터 일별 변화가 이어집니다.

  1. 순위 밖기준67,192기준

각 점은 해당 날짜의 공개 스냅샷입니다. 날짜가 빠진 구간은 선으로 추정하지 않고 확보한 기록만 표시합니다.

기준 정보

데이터 확인 기준

순위와 Star 수는 공개 목록을 확인한 스냅샷입니다. 실시간 값과 프로젝트의 최신 내용은 실제 저장소에서 확인할 수 있습니다.