핵심 역량
LLM 기반 애플리케이션의 전체 라이프사이클을 다룹니다. 모델 학습부터 평가, 프로덕션 서빙, 그리고 도메인 전문성과 협업 역량까지.
AI 산업 역량 레이어
Jensen Huang의 5-Layer 모델 기반 역량 분포 (GTC 2025)
드래그: 회전 · 스크롤: 확대/축소
L05
애플리케이션
LLM 서비스부터 에이전트 워크플로우까지
5.2
에이전트 & 워크플로우
LANGGRAPHTOOL CALLING
5.1
LLM 앱 & 서비스
LEGAL AIPROMPT
L04
모델
기반 모델부터 평가 시스템까지
4.3
평가 & 품질
LLM-AS-JUDGEG-EVAL
4.2
도메인 특화
FINE-TUNINGRETRIEVAL
4.1
파운데이션 모델
STRUCTURED OUTPUTCOT
L03
인프라
모델 서빙, 백엔드, 클라우드 인프라
L02
칩
GPU · HBM · 가속 컴퓨팅 프로세서
L01
공통 역량
프로그래밍 언어, 도구, 협업, 리더십
애플리케이션
LLM 앱 & 서비스
LLM Application Development
- 법률·비즈니스 문서 특화 프로덕션 LLM 앱
- 계약서 검토 AI 시스템 설계 및 구현
- 워크플로우 엔진 기반 멀티 시나리오 운영
- Widget 프로토콜 및 Rich UI 응답 설계
Prompt Engineering
- 법률·비즈니스 도메인 프롬프트 설계
- 생성·분류·추출 태스크별 최적화
- Playbook 기반 체계적 프롬프트 관리
- 38개 계약 유형별 프롬프트 템플릿 운영
Service Planning
- Playbook self-serve 구조 설계
- 데모 앱 기획 및 고객사 PoC 프로토타이핑
- 비개발자 사용자를 고려한 기능 기획
- 대형 보험사, 카드사 등 엔터프라이즈 PoC 실행
에이전트 & 워크플로우
AI Agent Development
- 메시지 기반 상태 관리 및 tool call 오케스트레이션
- 확인·질의 패턴 설계 (AskUserQuestion 등)
- 워크플로우 서브그래프 합성
- 에이전트 옵저버빌리티 (Opik/Sentry)
LangGraph / Workflow Engine
- LangGraph 기반 순환 에이전트 그래프 설계
- 10+ 법률 자동화 시나리오 프로덕션 운영
- Tool calling 및 서브그래프 합성
- SSE 스트리밍 기반 실시간 실행
모델 & 인텔리전스
파운데이션 모델
CPT / Domain Adaptation
• Llama·Solar 등 decoder LLM 범용 CPT 레시피 구축 • 법률 도메인 ~100GB 코퍼스 자체 구축 • LoRA + pretraining 결합으로 shift·overfit 제어 • 일반 역량 유지 + 도메인 지표 일관 상승
LoRA / PEFT / SFT / DPO
- Qwen2.5-14B 기반 5개 LoRA 어댑터 학습
- 체크리스트·편집·번역·추출·Contract-AI
- Multi-task SFT overall 0.9138 달성
- SFT→DPO 2단계 정렬 파이프라인
NLP / Transformer Modeling
- Transformer 기반 NLP 모델 개발
- 문서 이해·요약·정보 추출 태스크
- NAVER 클로바노트 제목 생성 모델
- HuggingFace 생태계 활용 실무
Model Quantization
- LLM.int8() 기반 OPT-13B RTX 3090 파인튜닝
- INT8+LoRA — FP16 대비 동등 성능, 메모리 3-17% 절감
- GPTQ, mixed-precision 양자화 경험
- QLoRA 이전 초기 탐색 (2022-2023)
Structured Output / Guided Decoding
- JSON schema, regex, FSM 기반 guided decoding
- vLLM structured output 정책 수립
- XGrammar 기반 100x 가속 파이프라인
- LoRAX structured output 오픈소스 기여
도메인 특화
Legal Document AI
- 계약서 검토·조항 분석·리스크 평가 시스템
- 특허 등록 (10-2867168)
- 2.5년간 220+ PR 프로덕션 운영
- 38개 계약 유형, 한/영/일 3개 언어 지원
Document Intelligence
- 문서 구조화·요약·제목 생성·정보 추출
- NAVER 클로바노트 제목 생성 모델 개발
- BHSN 법률 문서 인텔리전스 시스템 구축
- 계약서·의견서 등 비정형 문서 처리
Long-Context Serving (50K+ tokens)
- 54K-80K 토큰 EPC 계약서 서빙 최적화
- Prefix caching 기반 반복 패턴 가속
- Citation F1 평가 파이프라인 구축
- Needle-in-a-Haystack 위치 편향 분석·SFT 개선
RAG / Retrieval Systems
- 법률 도메인 특화 RAG 파이프라인 구축
- Hybrid retrieval + reranking 적용
- Citation 검증 및 조항 링킹 시스템
- Query transformation 기반 검색 정확도 개선
평가 & 데이터
LLM-as-a-Judge / G-Eval
- LLM 자동 채점 평가 시스템 설계
- G-Eval CoT 스코어링 적용
- 커스텀 Judge 모델 학습 (SFT+DPO)
- Claude 대비 70-80% 비용 절감
Domain-Specific Metric Design
- 도메인 특화 평가 지표 20+개 직접 설계
- 한국어 토큰화 ROUGE, citation F1
- Structured accuracy 등 법률 NLP 지표 체계
- 10+ 모델 벤치마크 비교 프레임워크
학습 데이터 파이프라인
- 전처리→필터링→합성→어노테이션 전체 파이프라인
- Positive/Negative 필터링 — 불량 데이터 48% 감소
- LLM 기반 합성 데이터 및 Weak Labeling
- SFT/DPO 학습셋 구축 및 품질 관리
어노테이션 & 분석 도구
- 비개발자용 어노테이션 UI 직접 설계·개발
- 평가 대시보드로 모델 성능·데이터 품질 시각화
- Streamlit 기반 빠른 프로토타이핑
- Weak label 일관성 검증 도구 구축
인프라 & 서빙
모델 서빙
vLLM
- Prefix caching, Structured Output, LoRA 서빙
- 다양한 GPU 스펙에 맞춘 서빙 & 테스트
- V0→V1 마이그레이션 — 84K 토큰 4.8x 가속
- PagedAttention 기반 GPU 메모리 최적화
LoRAX Multi-Adapter Serving
- Predibase LoRAX 기반 멀티 LoRA 어댑터 동시 서빙
- Shared base model + per-request adapter 라우팅
- Structured output 등 오픈소스 기여 (PR 4건 머지)
- vLLM V1 LoRA 지원 후 마이그레이션 완료
LiteLLM / Multi-Model Routing
- Model layer 분리한 multi-LLM 라우팅 플랫폼
- YAML config 기반 multi-vendor 모델 관리
- Dev/Stage/Prod 환경별 자동 배포
- fallback 및 load balancing 정책 설계
백엔드 & 클라우드
Docker
- ML 모델 서빙 컨테이너화
- Docker Compose 개발 환경 구성
- GPU 패스스루 및 CUDA 런타임 설정
- 사내 서비스 및 개발 환경 Docker 배포
온프레미스 & 폐쇄망
- AICA 지원사업 NHN Cloud GPU 환경 접근 및 세팅
- 사내 RTX A6000 48GB 워크스테이션 발주·설치
- 폐쇄망 환경을 고려한 시스템 설계 및 개발
- 군 복무 시 air-gapped 환경 운영
- 고객사 폐쇄망 배포 경험
클라우드 플랫폼
- GCP 주력 — Vertex AI, Cloud Run
- AWS, Azure 제한적 사용 경험
- 국내 클라우드 (Kakao·NHN·Naver Cloud) 비교 평가
- Docker 기반 사내 서비스 및 개발 환경 배포
FastAPI
- 프로덕션 AI API 서버 개발 (모델 서빙·비즈니스 로직)
- SSE 스트리밍 기반 실시간 응답
- X-Locale 헤더 다국어 지원 설계
- OpenAPI 스키마 자동화 및 문서화
칩 & 가속기
GPU · NPU · 가속기
GPU & NPU 가속기
- RTX 3060/3080/3090 학습·추론 실무
- A5000 24GB, A6000 48GB 벤치마크
- INT8+LoRA 단일 GPU 파인튜닝
- GPU 메모리 프로파일링 및 최적화
- NPU 협업 (Hyperaccel·Rebellions) 및 벤더 평가
Datacenter GPU (A100·H100)
- A100 80GB — vLLM V1 엔진 4.8x 가속
- H100 8-pack 멀티모달 법률 LLM 학습
- AICA 국가 컴퓨팅 프로그램 우수성과
- 대규모 모델 학습·서빙 인프라 운영
서빙 특화 GPU (T4·L40s)
- T4 — 비용 효율적 INT8 추론 서빙
- L40s — 고처리량 프로덕션 서빙
- Compute-bound vs Memory-bound 워크로드 분석
- 모델 크기·배치·시퀀스 기반 GPU 선정
공통 역량
언어 & 도구
Python
- 주력 언어 — AI/ML, 백엔드, 데이터 파이프라인 전반
- FastAPI, PyTorch, HuggingFace 생태계 실무
- 비동기 프로그래밍 (asyncio, aiohttp)
- 타입 힌트 기반 코드 품질 관리
Git / GitHub
- 코드 리뷰·PR 기반 협업 워크플로우
- 브랜치 전략 설계 및 CI/CD 연동
- GitHub Actions 파이프라인 구성
- 오픈소스 기여 (predibase/lorax PR 4건 머지)
Security Operations (Military)
- 폐쇄망 보안 모니터링 및 UTM 관리
- 보안 업무 자동화 스크립트 개발
- 사이버작전사령관 표창·정보보호 횃불상 수상
- 제로 의존성 환경 운영 경험
협업 & 리더십
Technical Communication
- LangCon 2024·Build with AI 외부 컨퍼런스 발표
- allibee 기술 블로그 2편 작성
- Confluence API 사양서 15건 직접 작성
- Google ML Bootcamp Alumni 발표
Project Ownership
- 한컴 프로젝트 단독 리드 (Confluence 전체 작성)
- 의사결정 로그·MVP 일정·리스크 관리
- AICA 성과보고서·제출물 관리
Cross-functional Coordination
- 제품·운영·QA·외부 파트너 이해관계자 협업
- AI 기능 제품 통합 및 배포 프로세스 설계
- Hancom/BoostDraft 파트너별 맞춤 전략
- B2G 파트너 연동 기술 조율