최근에 회사 프로젝트로 작은 LLM 모델을 도메인 특화 데이터로 파인튜닝 해봤습니다. 처음엔 간단할 거라 생각했는데 데이터 준비 단계에서 정말 시간이 오래 걸렸어요. 레이블링도 많이 필요하고, 데이터 품질 관리도 생각보다 까다롭더라고요.
학습 중에도 오버피팅이 자꾸 나타나서 여러 번 다시 돌렸습니다. 하이퍼파라미터 튜닝도 해봤는데 이게 정말 경험과 시행착오가 필요한 거 같아요. 결국 baseline 대비 성능은 나아졌는데, 과정이 훨씬 복잡했네요.
혹시 비슷한 경험 있으신 분들 계신가요? 데이터 준비나 튜닝 과정에서 효율적인 팁 있으면 공유해주시면 감사하겠습니다.
추천 0