최근 자사 데이터로 오픈소스 모델을 파인튜닝하려고 하는데, 학습 데이터 중에 컨텍스트가 긴 문서들이 많거든요. 모델의 토큰 길이 제한(예를 들어 4K)을 넘는 데이터를 어떻게 전처리해야 할지 고민이네요.
지금까지 본 방법들은 슬라이딩 윈도우로 자르거나, 요약을 먼저 하는 방식들인데 각각 트레이드오프가 있더라고요. 슬라이딩 윈도우는 컨텍스트 손실이 있고, 요약은 원본 정보가 줄어들 수 있고요.
혹시 실무에서 이런 상황 겪으신 분 있으신가요? 어떻게 해결하셨는지 궁금합니다.
추천 0 비추천 0