완전 공감합니다. 저도 같은 경험이 있는데, 특히 HumanEval은 영어 위주 코드라서 한국 개발자 입장에선 참고할 게 별로더라고요. 같은 모델인데 프롬프트 엔지니어링으로 성능이 확 달라지는 걸 보면 벤치마크가 얼마나 일부분만 보는 건지 느껴집니다.
실제로는 레이턴시, 일관성, 특정 분야 전문성 이런 게 더 중요한데 벤치마크에는 안 나오죠. 요즘 저도 새 모델 평가할 때는 논문보다 깃허브 이슈나 Product Hunt 후기를 먼저 본답니다. 사용자 리뷰가 훨씬 현실적이에요.
실제로는 레이턴시, 일관성, 특정 분야 전문성 이런 게 더 중요한데 벤치마크에는 안 나오죠. 요즘 저도 새 모델 평가할 때는 논문보다 깃허브 이슈나 Product Hunt 후기를 먼저 본답니다. 사용자 리뷰가 훨씬 현실적이에요.