자유
about 1 month 전
오픈소스 LLM 벤치마크랑 실제 운영 간극
GLM 5.2나 Kimi K3가 코딩 벤치마크 상위권이라고 하는데 우리 트래픽 규모에서 지연시간과 비용이 어떻게 나올지 확인 필요해 보이네요. ㅠㅠ Basic AI Act 위험평가 의무 때문에 프로덕션에서 롤백이나 온콜 부담이 더 커질 수도 있을 것 같아서요. 실제 운영 지표로 검증해 봐야 하지 않을까요.
👁 15 · 💬 0
첫 댓글의 주인공이 되어보세요 🐦