
AirLLM 深度解读:一张 4GB 显卡,凭什么跑得动 70B 甚至 2.8T 大模型
AirLLM 用「一次只把一层模型放进显存」的思路,让 70B 跑在 4GB 单卡、405B 在 8GB、DeepSeek-V3(671B) 在约 12GB、Kimi K3(2.8T) 甚至不到 4GB,且无需量化/蒸馏/剪枝。本文从原理、块式量化提速、MoE 按专家流式加载、一行代码上手到适用边界做一次技术向深度解读。

AirLLM 用「一次只把一层模型放进显存」的思路,让 70B 跑在 4GB 单卡、405B 在 8GB、DeepSeek-V3(671B) 在约 12GB、Kimi K3(2.8T) 甚至不到 4GB,且无需量化/蒸馏/剪枝。本文从原理、块式量化提速、MoE 按专家流式加载、一行代码上手到适用边界做一次技术向深度解读。

Headroom 是 AI Agent 的上下文压缩层:在工具输出、日志、RAG 片段与对话历史送入大模型前先在本地压缩,答案不变、token 大减。本文从架构、压缩原理、四种接入形态、实测数据到适用边界做一次技术向深度解读。