← 모든 프로젝트
Research2024

VRD-IU — 문서 레이아웃 정보 추출

복잡한 PDF를 영역별로 나누고 글자 정보와 좌표를 추출해 문서의 구조와 의미를 복원했습니다.

Contribution연구·개발
EvidenceIJCAI 2024 VRD-IU Track A·B

IJCAI 2024 VRD-IU Track A·B 1위

문서 정보 추출을 모델 성능만이 아닌 후처리·검증 구조로 확장

왜 만들었는가

문서의 텍스트만 추출하면 표·도형·영역 관계가 사라지므로 위치 정보와 레이아웃을 함께 다뤄야 했습니다.

내가 맡은 일

  • YOLOv8·YOLOv10·RT-DETR·LayoutLMv3 조합 실험
  • 누락 영역과 좌표 순서 오류를 보정하는 후처리 개발
  • 대회 데이터셋 평가와 결과 분석

구현과 구조

기능을 나열하기보다 데이터가 들어와 사용자의 결과가 되기까지의 흐름을 기준으로 정리했습니다.

  • 페이지를 의미 영역으로 검출하고 영역별 텍스트·좌표를 추출
  • 레이아웃 모델 결과를 후처리해 문서 순서와 누락을 보정
PythonPyTorchYOLOv8YOLOv10RT-DETRLayoutLMv3OCR