본문으로 건너뛰기

핵심 역량

LLM 기반 애플리케이션의 전체 라이프사이클을 다룹니다. 모델 학습부터 평가, 프로덕션 서빙, 그리고 도메인 전문성과 협업 역량까지.

AI 산업 역량 레이어

Jensen Huang의 5-Layer 모델 기반 역량 분포 (GTC 2025)

드래그: 회전 · 스크롤: 확대/축소
L05
애플리케이션
LLM 서비스부터 에이전트 워크플로우까지
5.2
에이전트 & 워크플로우
LANGGRAPHTOOL CALLING
5.1
LLM 앱 & 서비스
LEGAL AIPROMPT
L04
모델
기반 모델부터 평가 시스템까지
4.3
평가 & 품질
LLM-AS-JUDGEG-EVAL
4.2
도메인 특화
FINE-TUNINGRETRIEVAL
4.1
파운데이션 모델
STRUCTURED OUTPUTCOT
L03
인프라
모델 서빙, 백엔드, 클라우드 인프라
L02
GPU · HBM · 가속 컴퓨팅 프로세서
L01
공통 역량
프로그래밍 언어, 도구, 협업, 리더십

애플리케이션

LLM 앱 & 서비스

LLM Application Development
  • 법률·비즈니스 문서 특화 프로덕션 LLM 앱
  • 계약서 검토 AI 시스템 설계 및 구현
  • 워크플로우 엔진 기반 멀티 시나리오 운영
  • Widget 프로토콜 및 Rich UI 응답 설계
Prompt Engineering
  • 법률·비즈니스 도메인 프롬프트 설계
  • 생성·분류·추출 태스크별 최적화
  • Playbook 기반 체계적 프롬프트 관리
  • 38개 계약 유형별 프롬프트 템플릿 운영
Service Planning
  • Playbook self-serve 구조 설계
  • 데모 앱 기획 및 고객사 PoC 프로토타이핑
  • 비개발자 사용자를 고려한 기능 기획
  • 대형 보험사, 카드사 등 엔터프라이즈 PoC 실행

에이전트 & 워크플로우

AI Agent Development
  • 메시지 기반 상태 관리 및 tool call 오케스트레이션
  • 확인·질의 패턴 설계 (AskUserQuestion 등)
  • 워크플로우 서브그래프 합성
  • 에이전트 옵저버빌리티 (Opik/Sentry)
LangGraph / Workflow Engine
  • LangGraph 기반 순환 에이전트 그래프 설계
  • 10+ 법률 자동화 시나리오 프로덕션 운영
  • Tool calling 및 서브그래프 합성
  • SSE 스트리밍 기반 실시간 실행
관련 프로젝트 보기

모델 & 인텔리전스

파운데이션 모델

CPT / Domain Adaptation

• Llama·Solar 등 decoder LLM 범용 CPT 레시피 구축 • 법률 도메인 ~100GB 코퍼스 자체 구축 • LoRA + pretraining 결합으로 shift·overfit 제어 • 일반 역량 유지 + 도메인 지표 일관 상승

LoRA / PEFT / SFT / DPO
  • Qwen2.5-14B 기반 5개 LoRA 어댑터 학습
  • 체크리스트·편집·번역·추출·Contract-AI
  • Multi-task SFT overall 0.9138 달성
  • SFT→DPO 2단계 정렬 파이프라인
NLP / Transformer Modeling
  • Transformer 기반 NLP 모델 개발
  • 문서 이해·요약·정보 추출 태스크
  • NAVER 클로바노트 제목 생성 모델
  • HuggingFace 생태계 활용 실무
Model Quantization
  • LLM.int8() 기반 OPT-13B RTX 3090 파인튜닝
  • INT8+LoRA — FP16 대비 동등 성능, 메모리 3-17% 절감
  • GPTQ, mixed-precision 양자화 경험
  • QLoRA 이전 초기 탐색 (2022-2023)
Structured Output / Guided Decoding
  • JSON schema, regex, FSM 기반 guided decoding
  • vLLM structured output 정책 수립
  • XGrammar 기반 100x 가속 파이프라인
  • LoRAX structured output 오픈소스 기여

도메인 특화

Legal Document AI
  • 계약서 검토·조항 분석·리스크 평가 시스템
  • 특허 등록 (10-2867168)
  • 2.5년간 220+ PR 프로덕션 운영
  • 38개 계약 유형, 한/영/일 3개 언어 지원
Document Intelligence
  • 문서 구조화·요약·제목 생성·정보 추출
  • NAVER 클로바노트 제목 생성 모델 개발
  • BHSN 법률 문서 인텔리전스 시스템 구축
  • 계약서·의견서 등 비정형 문서 처리
Long-Context Serving (50K+ tokens)
  • 54K-80K 토큰 EPC 계약서 서빙 최적화
  • Prefix caching 기반 반복 패턴 가속
  • Citation F1 평가 파이프라인 구축
  • Needle-in-a-Haystack 위치 편향 분석·SFT 개선
RAG / Retrieval Systems
  • 법률 도메인 특화 RAG 파이프라인 구축
  • Hybrid retrieval + reranking 적용
  • Citation 검증 및 조항 링킹 시스템
  • Query transformation 기반 검색 정확도 개선

평가 & 데이터

LLM-as-a-Judge / G-Eval
  • LLM 자동 채점 평가 시스템 설계
  • G-Eval CoT 스코어링 적용
  • 커스텀 Judge 모델 학습 (SFT+DPO)
  • Claude 대비 70-80% 비용 절감
Domain-Specific Metric Design
  • 도메인 특화 평가 지표 20+개 직접 설계
  • 한국어 토큰화 ROUGE, citation F1
  • Structured accuracy 등 법률 NLP 지표 체계
  • 10+ 모델 벤치마크 비교 프레임워크
학습 데이터 파이프라인
  • 전처리→필터링→합성→어노테이션 전체 파이프라인
  • Positive/Negative 필터링 — 불량 데이터 48% 감소
  • LLM 기반 합성 데이터 및 Weak Labeling
  • SFT/DPO 학습셋 구축 및 품질 관리
어노테이션 & 분석 도구
  • 비개발자용 어노테이션 UI 직접 설계·개발
  • 평가 대시보드로 모델 성능·데이터 품질 시각화
  • Streamlit 기반 빠른 프로토타이핑
  • Weak label 일관성 검증 도구 구축
관련 프로젝트 보기

인프라 & 서빙

모델 서빙

vLLM
  • Prefix caching, Structured Output, LoRA 서빙
  • 다양한 GPU 스펙에 맞춘 서빙 & 테스트
  • V0→V1 마이그레이션 — 84K 토큰 4.8x 가속
  • PagedAttention 기반 GPU 메모리 최적화
LoRAX Multi-Adapter Serving
  • Predibase LoRAX 기반 멀티 LoRA 어댑터 동시 서빙
  • Shared base model + per-request adapter 라우팅
  • Structured output 등 오픈소스 기여 (PR 4건 머지)
  • vLLM V1 LoRA 지원 후 마이그레이션 완료
LiteLLM / Multi-Model Routing
  • Model layer 분리한 multi-LLM 라우팅 플랫폼
  • YAML config 기반 multi-vendor 모델 관리
  • Dev/Stage/Prod 환경별 자동 배포
  • fallback 및 load balancing 정책 설계

백엔드 & 클라우드

Docker
  • ML 모델 서빙 컨테이너화
  • Docker Compose 개발 환경 구성
  • GPU 패스스루 및 CUDA 런타임 설정
  • 사내 서비스 및 개발 환경 Docker 배포
온프레미스 & 폐쇄망
  • AICA 지원사업 NHN Cloud GPU 환경 접근 및 세팅
  • 사내 RTX A6000 48GB 워크스테이션 발주·설치
  • 폐쇄망 환경을 고려한 시스템 설계 및 개발
  • 군 복무 시 air-gapped 환경 운영
  • 고객사 폐쇄망 배포 경험
클라우드 플랫폼
  • GCP 주력 — Vertex AI, Cloud Run
  • AWS, Azure 제한적 사용 경험
  • 국내 클라우드 (Kakao·NHN·Naver Cloud) 비교 평가
  • Docker 기반 사내 서비스 및 개발 환경 배포
FastAPI
  • 프로덕션 AI API 서버 개발 (모델 서빙·비즈니스 로직)
  • SSE 스트리밍 기반 실시간 응답
  • X-Locale 헤더 다국어 지원 설계
  • OpenAPI 스키마 자동화 및 문서화
관련 프로젝트 보기

칩 & 가속기

GPU · NPU · 가속기

GPU & NPU 가속기
  • RTX 3060/3080/3090 학습·추론 실무
  • A5000 24GB, A6000 48GB 벤치마크
  • INT8+LoRA 단일 GPU 파인튜닝
  • GPU 메모리 프로파일링 및 최적화
  • NPU 협업 (Hyperaccel·Rebellions) 및 벤더 평가
Datacenter GPU (A100·H100)
  • A100 80GB — vLLM V1 엔진 4.8x 가속
  • H100 8-pack 멀티모달 법률 LLM 학습
  • AICA 국가 컴퓨팅 프로그램 우수성과
  • 대규모 모델 학습·서빙 인프라 운영
서빙 특화 GPU (T4·L40s)
  • T4 — 비용 효율적 INT8 추론 서빙
  • L40s — 고처리량 프로덕션 서빙
  • Compute-bound vs Memory-bound 워크로드 분석
  • 모델 크기·배치·시퀀스 기반 GPU 선정

공통 역량

언어 & 도구

Python
  • 주력 언어 — AI/ML, 백엔드, 데이터 파이프라인 전반
  • FastAPI, PyTorch, HuggingFace 생태계 실무
  • 비동기 프로그래밍 (asyncio, aiohttp)
  • 타입 힌트 기반 코드 품질 관리
Git / GitHub
  • 코드 리뷰·PR 기반 협업 워크플로우
  • 브랜치 전략 설계 및 CI/CD 연동
  • GitHub Actions 파이프라인 구성
  • 오픈소스 기여 (predibase/lorax PR 4건 머지)
Security Operations (Military)
  • 폐쇄망 보안 모니터링 및 UTM 관리
  • 보안 업무 자동화 스크립트 개발
  • 사이버작전사령관 표창·정보보호 횃불상 수상
  • 제로 의존성 환경 운영 경험

협업 & 리더십

Technical Communication
  • LangCon 2024·Build with AI 외부 컨퍼런스 발표
  • allibee 기술 블로그 2편 작성
  • Confluence API 사양서 15건 직접 작성
  • Google ML Bootcamp Alumni 발표
Project Ownership
  • 한컴 프로젝트 단독 리드 (Confluence 전체 작성)
  • 의사결정 로그·MVP 일정·리스크 관리
  • AICA 성과보고서·제출물 관리
Cross-functional Coordination
  • 제품·운영·QA·외부 파트너 이해관계자 협업
  • AI 기능 제품 통합 및 배포 프로세스 설계
  • Hancom/BoostDraft 파트너별 맞춤 전략
  • B2G 파트너 연동 기술 조율