ended2월 22일· 1 sources
LLM을 칩 위에 ‘인쇄’하는 Taalas의 방식
Why it matters
Taalas는 LLM의 가중치를 ASIC 칩에 직접 구현하여 GPU보다 10배 빠르고 저렴한 추론을 실현했다. 메모리 병목을 제거하고 양자화 기술을 활용해 초당 17,000토큰 속도를 달성했다. 모델별 맞춤형 칩 제작으로 2개월 만에 완성 가능해, 로컬 모델 실행의 새로운 패러다임을 제시한다.
1
Sources
+0
24h
—
Growth
211d
Active
ASICLLMTaalasLlama 3.1quantizationlatency