2023.08 — 현재 CURRENT
AI Engineer / NLP Engineer
BHSN
서울, 대한민국
- • 계약서 검토 AI 시스템 설계·개발 — 특허 등록(10-2867168)
- • 법률 특화 LLM 학습(SFT/DPO) · 서빙(vLLM) · 평가(LLM-as-a-Judge)
- • LangGraph 기반 워크플로우/에이전트 플랫폼 구축 — 10+ 시나리오 운영
- • 코드 구현 → 제품화 → 운영 → 비개발자 self-serve 구조 설계까지 연결
프로젝트 타임라인
기술 심화
LLM 서빙 인프라
- • PagedAttention 기반 vLLM — 초기 평가부터 K8s 프로덕션 배포까지 도입·운영
- • V0→V1 엔진 마이그레이션 — 84K 토큰 EPC 계약서 478초→100초 (4.8x 가속)
- • RadixAttention prefix caching으로 반복 계약 검토 패턴 최적화
- • LiteLLM 기반 멀티 모델 라우팅으로 GPU 메모리 효율화
Long-Context 법률 문서 처리
- • 54K-80K 토큰 법률 계약서 프로덕션 파이프라인 구축
- • 'Lost in the Middle' 현상 법률 도메인 실증 — Needle-in-a-Haystack 위치 분석
- • Long-context SFT — base Gemma-3 hit rate 0.081→0.383 (GPT-4.1 0.390 근접)
GPU 인프라 & 모델 학습
- • AICA 프로그램 — A100/H100 GPU 자원 확보·운영, 우수성과자 선정
- • Qwen2.5-14B 기반 5개 LoRA 어댑터 (체크리스트·편집·번역·추출·Contract-AI)
- • LlamaFactory 버그 패치 — 학습 시간 12h→3h (75% 단축)
- • LoRAX OSS 4개 PR 기여 — LoRA Land 논문의 서빙 인프라
Structured Output & Guided Decoding
- • JSON schema, regex, FSM 기반 guided decoding — 계약서 분류·체크리스트·드래프팅
- • vLLM/LoRAX 양쪽 response_format 정책 설계
- • LoRAX PR #644 — structured output 서빙 인터페이스 구현
평가 메트릭 시스템
- • 16+ 메트릭 직접 설계 — 정량 6개 + G-Eval 5개 + 계약 분할 5개
- • 법률 전문가 rubric 코드화 (정책 준수·수정 품질·문맥 일관성)
- • GPT-4.1 / Claude Sonnet 4 / 자체 Judge 모델 동시 지원
- • 10+ 모델 벤치마크 리더보드 운영
담당 업무
법률 및 비즈니스 문서 대상 NLP/LLM 시스템 개발
영문 계약서 검토 AI 모델 개발 — 체크리스트 검토, 수정 제안, 요약, SSE 스트리밍
법률 도메인 특화 LLM 학습(SFT/DPO) 및 데이터셋 운영
LLM 서빙 인프라 구축 및 최적화 — vLLM, LoRAX, structured output, long-context
AI 평가 메트릭 체계 설계·구현 — 전통 메트릭 + LLM-as-a-Judge + 인간 평가 rubric 통합
LangGraph 기반 워크플로우/에이전트 플랫폼 구축 — 10+ 법률 업무 시나리오 자동화
비개발자용 내부 authoring tool 개발 — prompt, template, workflow 자산 관리 UI
고객사 playbook self-serve 운영 구조 설계 및 구현
Cross-functional 팀 간 조율 — LegalOps, CLM, Agent Unit, QA, 외부 파트너
주요 프로젝트
Contract AI & Review Systems
계약서 추출·검토·리뷰·수정을 포괄하는 핵심 제품 API. FastAPI 기반 SSE 스트리밍, vLLM 서빙, structured output으로 2.5년 프로덕션 운영.
- 체크리스트 v2 human eval 80.41% (GPT-4o 79.16%)
- 38개 계약 유형 x 5개 언어
- 4개 고객사 PoC 배포
- 대한민국 등록특허 10-2867168
- 54K-80K 토큰 EPC 계약서 long-context 처리
LLM Training & Alignment Pipeline
법률 특화 LLM 학습 데이터셋 설계부터 SFT/DPO 학습, A100/H100 GPU 서비스 배포까지.
- Multi-task SFT overall 0.9138 (GPT-4.1 SOTA 0.8731 대비 +4.7%)
- 학습 시간 12h→3h (75% 단축, LlamaFactory 버그 패치)
- Qwen2.5-14B 기반 5종 task-specific LoRA 어댑터
- Long-context SFT: hit rate 0.081→0.383 (GPT-4.1 0.390 근접)
Workflow Platform & Agent Tooling
LangGraph 기반 워크플로우 엔진과 에이전트 플랫폼.
- 10+ 워크플로우 타입 production 배포
- Agent Legal 런칭 — paid workspaces 41→227 (팀 성과)
- Coding Agent CLI로 agentic testing 실현
AI Evaluation & Metrics System
법률 도메인 특화 평가 체계. 전통 정량 메트릭 + LLM-as-a-Judge + 법률 전문가 rubric 통합.
- 16+ 법률 AI task 메트릭 직접 설계·구현 (정량 6 + G-Eval 5 + 계약분할 5)
- GPT-4.1 / Claude Sonnet 4 / 자체 Judge 모델 동시 지원
- 10+ 모델 동시 벤치마크 리더보드
- 모델 앙상블 + 인간 검수 기반 gold standard 데이터셋 구축
OSS: predibase/lorax
S-LoRA(MLSys 2024), Punica(MLSys 2024) 연구를 실전 구현한 LoRAX에 OpenAI-compatible 인터페이스 개선 4 PR 머지.
- 2024-03 ~ 2024-10, Rust/Python 기여
- LoRA Land 논문(310개 모델 평가)의 서빙 인프라에 직접 기여
- 내부 fork → K8s production serving에 직접 활용
- structured output(PR #644) → 내부 계약 분류·체크리스트 파이프라인 적용
주요 성과
- 대한민국 등록특허 10-2867168 공동 발명자 (2025-09-26) ↗
- LangCon 2024 발표: Open Model Long Context Tuning ↗
- Build with AI for Everyone 발표: Structured Output Deterministic LLM ↗
- allibee 기술 블로그: Reasoning Legal AI ↗
- allibee 기술 블로그: RoPE/NoPE for Long-Context Documents ↗
- 한국일보 인터뷰: 진화하는 AI 엔지니어 ↗