본문으로 건너뛰기
프로젝트 목록

법률 도메인 LLM 학습 & 정렬

법률 도메인 LLM을 위한 End-to-end 학습 파이프라인. SFT, DPO, task-specific LoRA 어댑터를 활용하여 자체 정의한 계약 분석 벤치마크에서 지속적으로 성능을 고도화했습니다.

2023.09 — 2026.01 BHSN AI Engineer
LLM 학습 CPT Domain Adaptation SFT DPO LoRA 평가

개요

BHSN에서 법률 도메인 LLM의 전체 학습·정렬 파이프라인을 구축·운영했습니다. 데이터셋 큐레이션, SFT, 선호도 최적화, 계약 검토·조항 추출·문서 분석 전반의 multi-task 평가까지 포함합니다.

주요 성과

  • Llama·Solar 등 decoder LLM 에 범용적으로 적용 가능한 CPT 레시피와 약 100GB 규모 법률 도메인 코퍼스 자체 구축
  • 과도한 distribution shift·overfit 방지를 위해 LoRA 와 pretraining 을 결합한 Legal Domain Adaptive CPT 수행
  • 자체 구축 법률 도메인 평가셋(계약서 유형 분류, 민·형사 사건 유형 분류, 정책 검토, 법률 용어 4지선다, 변호사 시험 문항)에서 base 대비 일관된 향상
  • MMLU 등 일반 역량 지표는 유지된 채 타겟 도메인 지표만 선택적으로 상승 — 범용 성능 손실 없는 도메인 특화 달성
  • 이후 2024 Q2 ~ 2025 의 multi-task SFT 단계로 이어지는 foundation 마련

자체 벤치마크 기반 성능 고도화

  • Multi-task SFT 모델 overall 0.9138 — GPT-4.1 (0.8731) 대비 +4.7%
  • Party identification: 97.5%, query answerability: 95.75%
  • 체크리스트 모델 v2 human eval 80.41% (GPT-4o 79.16% 대비 동등 이상)

Long-Context 성능

  • 200K자 EPC 계약서 처리를 위한 모델 파인튜닝
  • Hit rate: base Gemma-3 0.081 → SFT 0.383 (GPT-4.1 0.390에 근접)

Task-Specific 어댑터

  • Qwen2.5-14B 백본 기반 5종 LoRA 어댑터 학습: 체크리스트 검토, 레드라인 수정, 번역, 라벨 추출, Contract-AI
  • 어댑터 기반 서빙으로 on-premise 배포와 상용 모델 대체 동시 추진

파이프라인 & 인프라

  • 13+ 레포에 걸친 데이터셋 운영 (체계적 버전 관리)
  • 평가 프레임워크: 전통 메트릭 + LLM-as-a-Judge + 법률 전문가 rubric
  • AICA 제공 H100x8 GPU 인프라로 학습
  • 10+ 모델 벤치마크 비교 (GPT-4.1, Claude Sonnet, Gemini, Qwen3, Gemma-3)

학술적 맥락

Task-specific LoRA 어댑터 학습은 LoRA(Hu et al., ICLR 2022)의 low-rank 적응 기법을 법률 도메인 멀티태스크에 확장한 것입니다. 선호도 최적화에는 reward model 없이 classification loss로 직접 정책을 최적화하는 DPO(Rafailov et al., NeurIPS 2023)를 적용하여 학습 안정성과 구현 단순성을 확보했습니다. 메모리 효율적 학습 측면에서는 QLoRA(Dettmers et al., NeurIPS 2023)의 양자화 기법도 참고하여 H100/A100 인프라에서 대규모 모델 학습을 운영했습니다.

이 프로젝트는 CPT → SFT → DPO 의 3단계 레이어드 학습으로, 각 단계에서 LoRA 를 결합해 catastrophic forgetting 과 과적합을 제어했습니다. 2024 Q1 의 Legal Domain Adaptive CPT 가 도메인 사전 노출을 만들고, 이어지는 multi-task SFT 가 overall 0.9138 을 달성해 GPT-4.1 SOTA(0.8731)를 리소스 효율적으로 넘어선 결과입니다. 단일 기법이 아닌 계층적 적응 전략이 법률 AI 의 실효적 경로임을 실증했습니다.

기술 스택

PyTorch, Transformers, PEFT/LoRA, vLLM, Weights & Biases, H100/A100 GPU