ended8월 3일· 1 sources

AirLLM 70B inference with single 4GB GPU

Why it matters

Quickstart | Configurations | MacOS | Example notebooks | FAQ AirLLM dramatically reduces inference memory usage, letting 70B large language models run on a single 4GB GPU card — without quantization,...

1
Sources
+0
24h
Growth
48d
Active

Sources

Related Issues