4GB显存跑通70B大模型,普通显卡也能做顶级AI推理(GitHub Trending)

今日 GitHub 热门项目 Top 6,已为你深度翻译整理。


1. lyogavin/airllm

  • 作者: lyogavin
  • 语言: Jupyter Notebook
  • ⭐ 星标: 25,625(今日 +819) | 🍴 Fork: 2,882
  • 许可证:Apache-2.0
  • 标签: chinese-llm, chinese-nlp, finetune, generative-ai, instruct-gpt, instruction-set, llama, llm, lora, open-models, open-source, open-source-models, qlora

项目定位: AirLLM通过逐层流式加载技术,大幅降低大模型推理显存需求,无需量化或剪枝即可在单张4GB显存的GPU上运行70B模型,甚至支持671B的DeepSeek-V3。

为你而选: 适合显存有限的开发者和AI爱好者。让你在普通消费级显卡甚至Mac上,零门槛跑起原本需要昂贵专业卡的顶级开源大模型。

想在一张普通的 4GB 显存显卡上跑起 70B 参数的大语言模型?AirLLM 把这件事变成了现实。它的核心思路很巧妙:推理时一次只在 GPU 上保留一层模型(对于 MoE 模型则是一次只流式加载一个专家),让所需显存取决于单层大小而非模型总大小。这样无需量化、剪枝或蒸馏,就能大幅降低显存门槛,甚至能在 12GB 显存上跑起 671B 的 DeepSeek-V3。

除了极致省显存,它还支持基于块级量化的模型压缩,在几乎不损失精度的前提下将推理速度提升 3 倍。兼容性也很出色,通过统一的 AutoModel 接口,支持 Llama、Qwen、DeepSeek、Mistral 等主流开源模型。

上手非常简单,只需 pip install airllm,然后像使用常规 Transformer 模型一样调用 AutoModel.from_pretrained("模型ID") 即可。

需要注意的是,首次运行时项目会将模型按层拆分并保存,请确保 Hugging Face 缓存目录有充足的磁盘空间。如果你是 Mac 用户,目前仅支持 Apple Silicon 芯片,且需提前安装好 mlx 和 torch。对于追求低门槛体验顶级开源大模型的开发者来说,这是一个非常实用的工具。


2. codecrafters-io/build-your-own-x

  • 作者: codecrafters-io
  • 语言: Markdown
  • ⭐ 星标: 534,816(今日 +674) | 🍴 Fork: 50,554
  • 主页:https://codecrafters.io
  • 标签: awesome-list, free, programming, tutorial-code, tutorial-exercises, tutorials

项目定位: 汇集了从零开始构建各种流行技术(如 Docker、Git、数据库、区块链等)的优质教程合集,帮助开发者通过造轮子来深入理解底层原理。

为你而选: 适合有一定编程基础、渴望深入理解系统底层原理的开发者。你可以跟着教程用熟悉的语言手写一个数据库或容器,实现从使用者到创造者的跨越。

理查德·费曼说过:“我不能创造的东西,我就不理解。” build-your-own-x 正是践行这一理念的编程学习宝库。它不教你如何调包,而是收集了大量高质量的“造轮子”教程,带你从零开始重建日常开发中耳熟能详的技术。

项目按技术类别分类,涵盖了从 3D 渲染器、AI 模型、BitTorrent 客户端,到区块链、数据库、Docker、操作系统、Git 甚至 Web 服务器等数十个领域。每个条目都标明了使用的编程语言和外部教程链接,支持 C、Go、Python、Rust、JavaScript 等多种语言。

它的核心价值在于“知其然,更知其所以然”。比如你想搞懂 Docker,可以跟着“用不到 100 行 Go 代码构建容器”的教程走一遍;想理解数据库,可以用 C 语言从 B+ 树写到 SQL。这些教程大多来自社区高赞博客或开源书籍,质量有保障。

使用上,它更像是一个学习导航站,无需安装,直接在 GitHub 仓库按目录浏览,找到感兴趣的领域和语言,点击链接即可开始阅读。需要注意的是,这些教程难度跨度较大,部分涉及底层系统的项目需要你具备一定的编程基础和耐心。如果你厌倦了只做 API 调用,想真正看透技术的黑盒,这里是绝佳的起点。


3. Panniantong/Agent-Reach

  • 作者: Panniantong
  • 语言: Python
  • ⭐ 星标: 64,674(今日 +659) | 🍴 Fork: 5,346
  • 许可证:MIT
  • 标签: agent-infrastructure, ai-agent, ai-search, automation, bilibili, claude-code, cli, cursor, free-api, llm-tools, mcp, python, reddit-scraper, twitter-scraper, web-scraper, xiaohongshu, youtube-transcript

项目定位: 给 AI Agent 一键装上互联网能力,支持读取和搜索 Twitter、Reddit、YouTube、B站、小红书等十余个平台,零 API 费用。

为你而选: 适合使用 Claude Code、Cursor 等 AI Agent 的开发者;让 Agent 突破信息孤岛,自动完成全网调研、视频总结和社交平台数据抓取。

AI Agent 写代码很在行,但一旦让它去网上找点东西——比如看看 YouTube 视频讲了啥、搜搜 Reddit 上的讨论、读读小红书的帖子——往往就抓瞎了:要么 API 要付费,要么 IP 被封,要么需要复杂的登录态。Agent Reach 解决的就是这个痛点,它把各大平台的接入方式替你选好、装好、体检好,让 Agent 直接拥有读全网的能力。

它的核心亮点在于“能力层”设计。它不重新造轮子,而是整合了 yt-dlp、gh CLI、Jina Reader、Exa 等开源工具,每个平台都维护一个“首选+备选”的后端列表。如果某个接入方式失效了(比如 B站风控封死了 yt-dlp),它会自动切换到备选方案,用户完全无感。

快速上手非常简单,只需把一句话丢给你的 AI Agent(如 Claude Code、Cursor 等):

帮我安装 Agent Reach:https://raw.githubusercontent.com/Panniantong/agent-reach/main/docs/install.md

Agent 会自动完成安装和配置。装完后运行 agent-reach doctor 就能查看各渠道状态。网页、YouTube、RSS 等六个渠道装好即用,无需配置;Twitter、小红书等需要登录态的平台,直接对 Agent 说“帮我配 XXX”即可引导配置。

需要注意的是,涉及 Cookie 登录的平台存在封号风险,建议使用小号。本地运行完全免费且无需代理,只有部署在服务器上才可能需要每月约 1 美元的代理费用。


4. HarbourMasters/Lighthouse

  • 作者: HarbourMasters
  • 语言: C
  • ⭐ 星标: 218(今日 +65) | 🍴 Fork: 18
  • 许可证:CC0-1.0

项目定位: Lighthouse 是经典 N64 游戏《班卓熊大冒险》的现代跨平台原生移植版,支持高清渲染、自定义资产和 Mod 扩展,让老游戏焕发新生。

为你而选: 适合怀旧玩家和 Mod 开发者。玩家可在 PC 上以更高兼容性重温经典,开发者可利用其工具链制作自定义资产和 Romhacks 扩展。

Lighthouse 是 Harbour Masters 团队带来的《班卓熊大冒险》原生 PC 移植版。它采用“脱壳重制”的思路,本身不包含任何版权资产,需要你自备合法的 N64 ROM,既合规又保留了原汁原味的体验。

核心特性与技术看点
项目基于 libultraship 框架开发,支持 DirectX11、OpenGL 和 Metal 三种图形后端,完美跨平台兼容 Windows、Linux 和 macOS。除了基础游玩,它还内置了强大的扩展能力:支持多区域 ROM 作为语言包(如 PAL 版自带英法德语),甚至能直接提取并加载 Romhacks 和自定义资产(.o2r/.otr 格式)。对于想自己动手的创作者,项目还推荐了 retro 和 fast64 等配套工具。

快速上手
1. 前往 GitHub Releases 页面下载对应系统的压缩包并解压。
2. 准备一份校验过的 .z64 格式 ROM(如果是 .n64 格式需先用工具转换)。
3. 运行程序(如 Windows 下的 lighthouse.exe),选择你的 ROM 即可生成数据并开始游戏。
默认键盘映射已贴心配置好(WASD 控制移动,X/C 对应 A/B 键),手柄也支持自定义映射。

注意事项
使用 Romhacks 功能时,目前仅支持 US v1.0 版本作为基础文件,建议以此版本为准以获得最佳兼容性。如果遇到图形崩溃,可以尝试在配置文件 lighthouse.cfg.json 中手动切换渲染后端至 OpenGL。


5. antirez/ds4

  • 作者: antirez
  • 语言: C
  • ⭐ 星标: 19,983(今日 +139) | 🍴 Fork: 1,774
  • 许可证:MIT

项目定位: 专为 DeepSeek V4 Flash/PRO 及 GLM 5.2 优化的本地推理引擎,支持 Metal、CUDA 和 ROCm,让高端消费级硬件也能流畅运行强大模型。

为你而选: 适合拥有大内存 Mac 或多卡 CUDA 服务器的开发者。可用于搭建本地多用户 LLM 服务,或在内存不足时通过 SSD 流式加载运行大模型。

DwarfStar(ds4)不是一个通用的 GGUF 运行器,它的目标非常明确:让 DeepSeek V4 Flash/PRO 和 GLM 5.2 在你的个人电脑或旧服务器上跑起来。它针对 Metal、CUDA 和 ROCm 进行了深度优化。

核心亮点
非对称量化:2-bit 量化只作用于占大头的路由 MoE 专家,而共享专家和投影层保持原样,在大幅压缩体积的同时保住了模型质量。
SSD 流式加载:如果你的 Mac 内存不够装下整个模型,它可以把路由专家放在 SSD 上按需加载,虽然慢一点,但能跑通。
多机并行:支持多 GPU 张量并行和流水线并行,甚至能把两台 Mac 的内存拼起来跑大模型。

快速上手
通过脚本下载指定量化版本的模型,例如 ./download_model.sh q2-imatrix。然后根据平台编译,Mac 上直接 make,CUDA 环境用 make cuda-generic。运行 ./ds4 -m ds4flash.gguf 即可启动。

注意事项
项目目前处于 Beta 阶段,变动较快。它只认自己配套的特定 GGUF 文件,不支持随便丢一个模型进去跑。另外,作者坦诚项目是在 GPT 和 Claude 的强力辅助下开发的,如果你介意 AI 生成的代码,这可能不适合你。


6. esengine/DeepSeek-Reasonix

  • 作者: esengine
  • 语言: Go
  • ⭐ 星标: 29,041(今日 +333) | 🍴 Fork: 1,867
  • 许可证:MIT | 主页:http://reasonix.io/
  • 标签: agent, agent-framework, ai-agent, ai-coding, cli, coding-agent, deepseek, developer-tools, ink, llm, prompt-caching, r1, terminal, tool-use, tui, typescript

项目定位: 专为 DeepSeek 优化的终端 AI 编码代理,采用配置与插件驱动,单文件分发,针对前缀缓存优化以降低长会话成本。

为你而选: 适合开发者在终端、桌面端或 VS Code 中进行 AI 辅助编程,能有效降低长会话的 token 成本并支持多模型协作。

Reasonix 是一个为 DeepSeek 量身定制的终端 AI 编码代理。它最核心的看点在于对前缀缓存(prefix cache)的稳定性优化——在长会话编程场景下,这能显著降低 token 消耗成本,让你可以放心地让它一直挂着跑。

在技术实现上,它用 Go 编译成单一静态二进制文件(CGO_ENABLED=0),除了一个 TOML 解析器外没有其他依赖,跨平台分发极其轻量。架构设计上,它强调配置与插件驱动:模型、工具和插件都在 reasonix.toml 中声明,没有硬编码的模型;外部工具通过 stdio JSON-RPC(兼容 MCP)以子进程方式运行。它还支持双模型协作模式(如 executor + planner),在各自独立的缓存稳定会话中运行。

上手非常简单。你可以通过 npm i -g reasonix 或 macOS 上的 brew install esengine/reasonix/reasonix 快速安装。随后执行 reasonix setup 配置好提供商和模型,就能用 reasonix 启动交互式会话,或直接用 reasonix run "implement the TODOs in main.go" 派发任务。

除了 CLI/TUI,它还提供桌面应用和 VS Code 扩展。需要注意的是,VS Code 扩展本身不包含 CLI,你需要先完成命令行版本的安装,扩展会调用本地的 reasonix acp 后端来提供编辑器内的交互能力。


感谢阅读!如有疑问请留言
上一篇