GPT-4에게 보고서 초안을 맡겼더니, 내용은 그럴싸한데 우리 팀 내부 약어를 하나도 못 잡아냈다. 인터넷에 없는 것—비공개 제품명, 사내 전용 용어—이 조금이라도 끼어들면 바로 엉뚱한 문장이 튀어나온다. 범용 AI는 분명히 똑똑하다. 근데 ‘우리 회사 전문가’는 아니다. 이 공백을 메우는 기술이 파인튜닝(Fine-tuning)이다.
파인튜닝, 요컨대 AI한테 OJT 시키는 것
비유하자면 대기업 공채 신입에게 우리 팀 업무를 OJT로 가르치는 과정이다. 언어 능력이나 추론 같은 기본기는 이미 갖춰져 있다. 거기에 우리 회사만의 데이터—내부 문서, 고객 문의 내역, 기술 자료—를 추가로 먹이는 거다. 그러면 AI가 우리 팀 말투, 전문 용어, 업무 스타일을 체득한 맞춤형 어시스턴트로 탈바꿈한다. 범용 모델이 가진 언어 이해력은 그대로 유지하면서, 전혀 없던 도메인 전문성이 올라오는 구조다.
범용 모델이 80점에서 멈추는 이유
초기 LLM이 나왔을 때는 세대마다 성능이 10배씩 뛰는 충격이 있었다. 지금은 그 곡선이 완만해졌다. MIT 테크 리뷰 분석도 같은 결론을 냈다. 범용 모델의 성능 향상은 점진적인 반면, 특정 도메인에 맞춘 모델은 아직도 폭발적인 개선이 가능하다고.
이유는 단순하다. GPT-4가 아무리 방대한 인터넷 데이터를 학습했어도, 거기에 우리 회사 비공개 재무제표나 고객 상담 기록, 내부 개발 문서는 없다. 결국 범용 AI는 어떤 주제든 80점짜리 답변은 내놓을 수 있어도, 우리 조직의 특정 문제에 100점을 찍기가 어려운 구조다.
파인튜닝 작동 원리: 3단계
복잡해 보이지만 원리는 세 단계로 떨어진다.
- 1단계: 데이터 준비 (Garbage in, Garbage out)
성패를 가르는 단계다. 고객 서비스 챗봇을 목표로 한다면, ‘질문-답변’ 형태로 정리된 FAQ 수천 건이 필요하다. 데이터 품질이 곧 모델 성능이다. 이 단계를 대충 넘기면 이후 과정이 전부 헛수고가 된다. - 2단계: 모델 재훈련
이미 방대한 데이터로 학습된 ‘사전 학습 모델(Pre-trained Model)’을 가져와 준비한 데이터를 추가로 학습시킨다. 처음부터 모델을 쌓아 올리는 구조가 아니라서, 훨씬 적은 데이터와 비용으로도 높은 성능을 뽑아낼 수 있다. 모델은 이 과정에서 새 데이터의 패턴과 스타일을 내재화한다. - 3단계: 평가 및 배포
학습 완료 후 테스트 데이터셋으로 성능을 검증한다. 합격점이 나오면 실제 서비스에 올린다. 단번에 통과하는 경우는 드물고, 대부분 이 단계를 반복하며 모델을 다듬는다.
파인튜닝 vs. 프롬프트 엔지니어링, 뭘 골라야 하나
둘 다 AI에서 원하는 결과를 뽑아내는 방법이지만, 접근 방식이 완전히 다르다.
- 프롬프트 엔지니어링: AI는 건드리지 않고, ‘지시문(프롬프트)’을 정교하게 다듬는 기술이다. 역할 부여, 배경 설명, 구체적 예시를 조합해서 원하는 결과를 유도하는 방식이다. 빠르고 저렴하지만 매번 긴 지시문을 붙여야 하고, 일관성 유지가 까다롭다.
- 파인튜닝: 지시문이 아니라 AI 모델 자체를 재설계하는 기술이다. 회사 데이터로 모델을 다시 훈련시켜, 짧은 질문에도 의도를 정확히 읽고 전문적 답변을 내놓도록 체질을 바꾼다. 초기 투자가 필요하지만 한번 세팅하면 훨씬 일관된 고품질 결과가 나온다.
일회성 작업이나 간단한 업무라면 프롬프트 엔지니어링으로 충분하다. 반복적이고 전문성이 요구되는 핵심 업무는 파인튜닝이 확실히 유리하다. 솔직히 이 판단 자체가 제일 어렵다. 데이터 준비 비용을 감당할 수 있는지, 반복 사용 빈도가 투자를 정당화하는지 먼저 따져봐야 한다.
파인튜닝이 빛을 발하는 상황 4가지
모든 케이스에 파인튜닝이 맞지는 않는다. 아래 조건에 해당한다면 진지하게 검토할 만하다.
- 전문 분야 특화 챗봇: 법률, 의료, 금융 등 특정 분야의 전문 용어와 지식을 학습시켜, 변호사나 의사를 보조하는 AI 어시스턴트로 만들 수 있다.
- 내부 문서 검색·요약: 방대한 사내 기술 문서와 보고서를 학습시키면, 직원이 질문 하나로 필요한 정보를 즉시 찾고 요약받는 환경이 만들어진다.
- 코드 생성 자동화: 회사 코딩 스타일과 라이브러리 구조를 학습시켜, 개발 생산성을 크게 끌어올리는 맞춤형 코드 생성 도구로 활용된다.
- 고객 응대 자동화: 제품 정보, 정책, CS 매뉴얼을 학습시키면 24시간 일관된 톤으로 정확한 답변을 내놓는 챗봇 운영이 현실이 된다.
다음 수순은 결국 ‘나만의 AI’
지금까지는 구글, OpenAI 같은 빅테크가 만든 AI를 빌려 쓰는 구조였다. 파인튜닝 기술이 대중화되면서 이 판도가 달라지고 있다. 범용 AI의 한계가 느껴진다면, 조직 내부 데이터를 활용해 AI를 직접 튜닝하는 쪽으로 방향을 잡을 때다. MIT 테크 리뷰가 “모델 커스터마이제이션은 이제 선택이 아닌 아키텍처 필수 요소”라고 표현한 게 괜한 말이 아니다. 자사 데이터를 어떻게 쓰느냐가 AI 시대의 실질적 경쟁력을 가른다.
