2026.06.13 접속자 31
로그인 회원가입
HOT
[AI뉴스] 2026년 AI는 에이전트 시대로... 생성형 AI는 이제 지나간 얘기인가요? [프롬프트] 실무에서 쓸 만한 프롬프트 템플릿 찾으시는 분 계신가요? [프롬프트] Claude에 이 프롬프트 먹였더니 코드 리뷰가 완전 달라지네요 [AI뉴스] 요즘 AI 기업들 진짜 미친 속도로 움직이고 있네요 [기술 Q&A] LLM으로 코드 리뷰 자동화 돌려본 후기 [기술 Q&A] LLM 파인튜닝할 때 LoRA vs 풀 파인튜닝, 실제로 뭐가 다른가요? [프롬프트] LLM 분석 결과 정리할 때 쓰는 프롬프트 공유합니다 [AI뉴스] AI도 이제 손발이 생겼네요... 챗봇에서 에이전트 AI로 넘어가는 중 [프롬프트] 코드 리뷰 요청할 때 쓸 만한 프롬프트 있으신가요? [AI뉴스] 요즘 AI 회사들 자금 유치 진짜 미친 수준이더라고요 [AI뉴스] 2026년 AI는 에이전트 시대로... 생성형 AI는 이제 지나간 얘기인가요? [프롬프트] 실무에서 쓸 만한 프롬프트 템플릿 찾으시는 분 계신가요? [프롬프트] Claude에 이 프롬프트 먹였더니 코드 리뷰가 완전 달라지네요 [AI뉴스] 요즘 AI 기업들 진짜 미친 속도로 움직이고 있네요 [기술 Q&A] LLM으로 코드 리뷰 자동화 돌려본 후기 [기술 Q&A] LLM 파인튜닝할 때 LoRA vs 풀 파인튜닝, 실제로 뭐가 다른가요? [프롬프트] LLM 분석 결과 정리할 때 쓰는 프롬프트 공유합니다 [AI뉴스] AI도 이제 손발이 생겼네요... 챗봇에서 에이전트 AI로 넘어가는 중 [프롬프트] 코드 리뷰 요청할 때 쓸 만한 프롬프트 있으신가요? [AI뉴스] 요즘 AI 회사들 자금 유치 진짜 미친 수준이더라고요

LLM 파인튜닝할 때 데이터셋 크기가 정말 중요한가요?

흐름타는개발자 2026.04.13 14:09 조회 88 추천 10 댓글 3건
요즘 회사에서 특정 도메인용 챗봇을 만들어야 하는데 파인튜닝을 고민 중입니다. 근데 자료를 찾아보니까 의견들이 왔다갔다 하더라고요. 어떤 글은 1000개 데이터면 충분하다고 하고 어떤 글은 최소 10만 개는 필요하다고 하고요.

저희 팀에서 확보할 수 있는 데이터가 약 5000개 정도 되는데, 이 정도면 실무에서 의미 있는 성능 개선이 가능할까요? 그리고 파인튜닝 말고 프롬프트 엔지니어링으로 먼저 해보는 게 나을 수도 있을 것 같긴 한데 정확히 언제쯤 파인튜닝으로 넘어가야 하는지 판단 기준이 있나요?

또 하나 궁금한 게 모델 선택인데요. GPT-4를 파인튜닝할 수 없다는 건 알겠는데, GPT-3.5랑 오픈소스 모델(라마 같은) 중에서는 어떤 걸 선택하는 게 실제로는 유리한가요? 비용도 중요하고 성능도 중요하고 배포도 고려해야 하는데 트레이드오프를 어떻게 생각해야 할까요?

마지막으로 파인튜닝 후에 평가는 어떻게 하시나요? 테스트셋으로만 하면 되는 건지, 아니면 실제 프롬프트로 직접 써보면서 평가하는 게 더 중요한가요? 저희는 정량적 지표보다는 실제 사용자 만족도가 더 중요한 상황이라서요.

처음 해보는 거라 기초적인 질문들이지만 조언 부탁드립니다.
추천 10
댓글 3

댓글목록

profile_image
오늘도살자
5000개면 충분히 의미 있는 개선를 볼 수 있습니다. 저도 비슷한 규모로 해봤는데 프롬프트 엔지니어링만으로는 한계가 있더라고요.
파인튜닝 타이밍은 프롬프트로 아무리 해도 성능이 안 올라올 때가 판단 기준이에요. 보통 정확도 80% 이상에서 더 안 올라오면 그때 시도해볼 만합니다.
모델 선택은 정직하게 비용 vs 성능 트레이드오프인데, GPT-3.5 파인튜닝은 비용이 나쁘지 않고 성능도 괜찮거든요. 다만 배포할 거면 라마 같은 오픈소스가 낫습니다. 자체 서버에서 돌릴 수 있으니까요.
평가는 테스트셋 지표
profile_image
인공지능개그맨
5000개면 충분히 의미 있는 성능 개선 가능해요. 저도 비슷한 크기로 해봤는데 프롬프트만으로는 못 뽑아내던 퀄리티가 나왔어요.
근데 진짜 중요한 건 데이터 품질이거든요. 10만 개라도 노이즈 많으면 별로더라고요. 차라리 5000개 깔끔한 걸 반복해서 쓰는 게 낫습니다.
모델 선택은 배포 환경에 따라 다를 것 같아요. 회사 서버에 올린다면 라마 같은 오픈소스가 비용 면에서 훨씬 유리하고, API로만 쓸 거면 GPT-3.5가 편하긴 해요.
평가는 테스트셋은 기본이고 실제 도메인 전문가가 직접 써보면서 체크하
profile_image
조용한엔지니어
5000개면 충분히 가능하더라고요. 저희도 비슷한 규모로 시작했는데 프롬프트 잘 짜서 먼저 베이스라인 잡고, 부족한 부분만 파인튜닝했거든요. GPT-3.5는 비용이 싸긴 한데 라마 같은 오픈소스가 배포 자유도는 훨씬 낫습니다. 평가는 테스트셋과 실제 프롬프트 섞어서 해야 의외 케이스도 잡을 수 있어요.