본문으로 건너뛰기
경력으로 돌아가기

프로젝트 타임라인

AI 계약서 검토 시스템 진행중
2023 Q3 — 현재
LLM 학습 & 정렬
2023 Q4 — 2025 Q3
AI 서비스 평가 시스템 진행중
2023 Q3 — 현재
OSS: lorax
2024 Q1 — 2024 Q4
Workflow & Agent 진행중
2024 Q2 — 현재
파트너 통합 진행중
2025 Q3 — 현재

기술 심화

LLM 서빙 인프라

  • PagedAttention 기반 vLLM — 초기 평가부터 K8s 프로덕션 배포까지 도입·운영
  • V0→V1 엔진 마이그레이션 — 84K 토큰 EPC 계약서 478초→100초 (4.8x 가속)
  • RadixAttention prefix caching으로 반복 계약 검토 패턴 최적화
  • LiteLLM 기반 멀티 모델 라우팅으로 GPU 메모리 효율화

Long-Context 법률 문서 처리

  • 54K-80K 토큰 법률 계약서 프로덕션 파이프라인 구축
  • 'Lost in the Middle' 현상 법률 도메인 실증 — Needle-in-a-Haystack 위치 분석
  • Long-context SFT — base Gemma-3 hit rate 0.081→0.383 (GPT-4.1 0.390 근접)

GPU 인프라 & 모델 학습

  • AICA 프로그램 — A100/H100 GPU 자원 확보·운영, 우수성과자 선정
  • Qwen2.5-14B 기반 5개 LoRA 어댑터 (체크리스트·편집·번역·추출·Contract-AI)
  • LlamaFactory 버그 패치 — 학습 시간 12h→3h (75% 단축)
  • LoRAX OSS 4개 PR 기여 — LoRA Land 논문의 서빙 인프라

Structured Output & Guided Decoding

  • JSON schema, regex, FSM 기반 guided decoding — 계약서 분류·체크리스트·드래프팅
  • vLLM/LoRAX 양쪽 response_format 정책 설계
  • LoRAX PR #644 — structured output 서빙 인터페이스 구현

평가 메트릭 시스템

  • 16+ 메트릭 직접 설계 — 정량 6개 + G-Eval 5개 + 계약 분할 5개
  • 법률 전문가 rubric 코드화 (정책 준수·수정 품질·문맥 일관성)
  • GPT-4.1 / Claude Sonnet 4 / 자체 Judge 모델 동시 지원
  • 10+ 모델 벤치마크 리더보드 운영

담당 업무

법률 및 비즈니스 문서 대상 NLP/LLM 시스템 개발

영문 계약서 검토 AI 모델 개발 — 체크리스트 검토, 수정 제안, 요약, SSE 스트리밍

법률 도메인 특화 LLM 학습(SFT/DPO) 및 데이터셋 운영

LLM 서빙 인프라 구축 및 최적화 — vLLM, LoRAX, structured output, long-context

AI 평가 메트릭 체계 설계·구현 — 전통 메트릭 + LLM-as-a-Judge + 인간 평가 rubric 통합

LangGraph 기반 워크플로우/에이전트 플랫폼 구축 — 10+ 법률 업무 시나리오 자동화

비개발자용 내부 authoring tool 개발 — prompt, template, workflow 자산 관리 UI

고객사 playbook self-serve 운영 구조 설계 및 구현

Cross-functional 팀 간 조율 — LegalOps, CLM, Agent Unit, QA, 외부 파트너

주요 프로젝트

Contract AI & Review Systems

계약서 추출·검토·리뷰·수정을 포괄하는 핵심 제품 API. FastAPI 기반 SSE 스트리밍, vLLM 서빙, structured output으로 2.5년 프로덕션 운영.

  • 체크리스트 v2 human eval 80.41% (GPT-4o 79.16%)
  • 38개 계약 유형 x 5개 언어
  • 4개 고객사 PoC 배포
  • 대한민국 등록특허 10-2867168
  • 54K-80K 토큰 EPC 계약서 long-context 처리

LLM Training & Alignment Pipeline

법률 특화 LLM 학습 데이터셋 설계부터 SFT/DPO 학습, A100/H100 GPU 서비스 배포까지.

  • Multi-task SFT overall 0.9138 (GPT-4.1 SOTA 0.8731 대비 +4.7%)
  • 학습 시간 12h→3h (75% 단축, LlamaFactory 버그 패치)
  • Qwen2.5-14B 기반 5종 task-specific LoRA 어댑터
  • Long-context SFT: hit rate 0.081→0.383 (GPT-4.1 0.390 근접)

Workflow Platform & Agent Tooling

LangGraph 기반 워크플로우 엔진과 에이전트 플랫폼.

  • 10+ 워크플로우 타입 production 배포
  • Agent Legal 런칭 — paid workspaces 41→227 (팀 성과)
  • Coding Agent CLI로 agentic testing 실현

AI Evaluation & Metrics System

법률 도메인 특화 평가 체계. 전통 정량 메트릭 + LLM-as-a-Judge + 법률 전문가 rubric 통합.

  • 16+ 법률 AI task 메트릭 직접 설계·구현 (정량 6 + G-Eval 5 + 계약분할 5)
  • GPT-4.1 / Claude Sonnet 4 / 자체 Judge 모델 동시 지원
  • 10+ 모델 동시 벤치마크 리더보드
  • 모델 앙상블 + 인간 검수 기반 gold standard 데이터셋 구축

OSS: predibase/lorax

S-LoRA(MLSys 2024), Punica(MLSys 2024) 연구를 실전 구현한 LoRAX에 OpenAI-compatible 인터페이스 개선 4 PR 머지.

  • 2024-03 ~ 2024-10, Rust/Python 기여
  • LoRA Land 논문(310개 모델 평가)의 서빙 인프라에 직접 기여
  • 내부 fork → K8s production serving에 직접 활용
  • structured output(PR #644) → 내부 계약 분류·체크리스트 파이프라인 적용

활용 기술

PyTorchvLLMLangGraphFastAPIPostgreSQLLoRA/PEFTSFT/DPOStructured OutputSSE StreamingDockerKubernetesGitHub ActionsStreamlitLiteLLMRustA100/H100 GPU