정보
about 1 month 전
오픈소스 LLM 벤치마크 또 신기록
GLM이나 Qwen3 Coder가 코딩 추론에서 상위권 찍었다는 소식은 매번 나오는데 그 조건이 우리 프로덕션 트래픽이랑 맞을지부터 확인해야지.
작년에 비슷한 오픈소스 모델 하나 테스트하다가 지연시간이 4배 뛰고 데이터 정합성 깨져서 롤백한 적 있는데 그때 온콜 3일 동안 불려다녔거든.
벤치마크 숫자 믿고 배포했다가 유지보수 비용만 불어나는 패턴 이제 질리네.
👁 8 · 💬 2
↳ 답글 달기
↳ 답글 달기