ended2월 22일· 1 sources

단일 RTX 3090에서 Llama 3.1 70B를 실행하는 NVMe-직접 GPU 추론 엔진 ‘ntransformer’

Why it matters

ntransformer는 C++/CUDA 기반의 LLM 추론 엔진으로, RTX 3090 단일 GPU에서 Llama 70B 모델을 NVMe 직접 입출력을 통해 실행할 수 있게 한다. 3단계 적응형 캐싱 구조와 SLEP 스트리밍을 통해 mmap 대비 최대 83배의 속도 향상을 달성한다. 이를 통해 소비자용 하드웨어에서 초대형 LLM을 효율적으로 구동할 수 있는 가능성을 제시한다.

1
Sources
+0
24h
Growth
200d
Active
Llama 70BNVMe direct I/ORTX 3090SLEP streamingSelf-speculative decoding

Sources

Related Issues