ended8월 23일· 1 sources

로컬 LLM이 실제 성능보다 더 멍청하게 느껴지는 이유

Why it matters

<ul> <li>같은 모델 가중치라도 <strong>GPU 명령어·추론 소프트웨어·정밀도 설정</strong>이 다르면 다음 토큰 확률이 달라지고, 긴 문맥에서는 도구 호출 실패로 이어질 수 있음</li> <li>Qwen3.6-27B와 약 10만 토큰의 실제 에이전트 작업 문맥을 실험한 결과, vLLM의 <strong>어텐션 백엔드</strong> 차이는 ...

1
Sources
+0
24h
Growth
11d
Active

Sources

Related Issues