ended8월 3일· 1 sources
AirLLM 70B inference with single 4GB GPU
Why it matters
Quickstart | Configurations | MacOS | Example notebooks | FAQ AirLLM dramatically reduces inference memory usage, letting 70B large language models run on a single 4GB GPU card — without quantization,...
1
Sources
+0
24h
—
Growth
48d
Active