让AI把文档直接变成原生可编辑幻灯片(GitHub Trending)

今日 GitHub 热门项目 Top 12,已为你深度翻译整理。


1. cathrynlavery/diagram-design

  • 作者: cathrynlavery
  • 语言: HTML
  • ⭐ 星标: 10,257(今日 +2,855) | 🍴 Fork: 668
  • 许可证:MIT

项目定位: 为 Claude Code 等 AI 助手提供编辑级图表设计能力的技能包,生成自包含的 HTML+SVG 图表,告别通用圆框和 Mermaid 垃圾。

为你而选: 适合开发者和内容创作者。无需 Figma,让 AI 助手在 60 秒内匹配你的网站品牌色和字体,直接生成高质量架构图、流程图等。

每次让 AI 画架构图或流程图,得到的总是千篇一律的通用圆框,和自己的网站风格完全不搭?Diagram Design 就是为了解决这个问题而生的。它是一个专为 Claude Code、Codex 和 Pi 等 AI 助手设计的技能包,能直接生成编辑级别的自包含 HTML+SVG 图表,没有多余的阴影,也不依赖 JavaScript。

项目内置了 27 种视觉类型,涵盖架构图、流程图、状态机、雷达图等,每种都有浅色、深色和全编辑三种变体。最亮眼的特性是它的“60秒品牌匹配”:只需告诉 AI 你的网址,它就会抓取网站的主色调和字体栈,自动映射到图表的语义角色中,并完成 WCAG AA 对比度检查。这意味着生成的图表天生就带着你品牌的视觉基因。

在技术实现上,它引入了语义系统模式,将行为描述与布局分离,让队列或信任边界等概念能复用现有图表类型。同时,可选的动效严格遵循无障碍标准,默认输出依然是静态且无脚本的。

上手非常简单,在 Claude Code 中执行 /plugin marketplace add cathrynlavery/diagram-design/plugin install diagram-design@diagram-design 即可安装。随后直接用自然语言提需求,比如“画一个带 Redis 缓存的应用架构图”,AI 就会自动选择合适的类型并生成文件。如果你已有 draw.io 或 Mermaid 图表,它还能将其重绘成这套设计系统的风格。值得注意的是,首次在新项目中使用时,它会主动确认是否需要运行品牌匹配,避免输出默认配色的图表。


2. macro-inc/macro

  • 作者: macro-inc
  • 语言: Rust
  • ⭐ 星标: 1,762(今日 +227) | 🍴 Fork: 221
  • 许可证:AGPL-3.0 | 主页:https://macro.com
  • 标签: agent, ai, ai-agents, all-in-one, crm, crm-system, email, linear, mcp, messaging, notes, notion, office, rust, slack, slack-alternative, startup, startup-tools, typescript, workspace

项目定位: Macro 是面向团队的统一工作区,将邮件、聊天、文档、任务、CRM 和 AI 代理整合在一个界面中,通过共享记忆和双向链接打破工具壁垒。

为你而选: 适合中小型团队或大公司中的小团队。开发者和团队成员可用它替代 Slack、Notion、Linear 等多套工具,在一个系统中完成沟通、协作与客户管理,大幅提升效率。

当团队规模扩大,Slack、Linear、Notion、HubSpot 等多套工具并用就会变成一场灾难:信息割裂、系统无法互通。Macro 的初衷就是打造一个统一的团队“操作系统”,把邮件、聊天、文档、任务、CRM 和 AI 代理全部塞进同一个界面。

它的核心亮点在于双向链接:邮件、消息、任务和文档之间不再是孤岛,而是通过原生的双向图关联。比如从一封客服邮件直接创建任务,或在文档里 @提及某封邮件,所有上下文都能无缝追溯。此外,它内置了团队级的 AI 共享记忆,每天自动从对话、邮件和任务中合成上下文,让 AI 代理能真正理解团队动态并代为执行操作。

技术栈上,Macro 采用 SolidJS 和 Rust 打造,追求极致速度与可靠性;文档编辑基于 CRDTs 实现实时协作与离线编辑,甚至允许 AI 代理作为“协作者”直接参与文档修改。

目前 README 未提供本地部署命令,感兴趣的话可以直接前往官网注册体验或查阅官方文档。如果你正受够了在多个工具间来回切换,Macro 提供了一种将所有工作流合而为一的新思路。


3. shiyu-coder/Kronos

  • 作者: shiyu-coder
  • 语言: Python
  • ⭐ 星标: 36,934(今日 +266) | 🍴 Fork: 6,149
  • 许可证:MIT

项目定位: Kronos 是首个专为金融市场 K 线序列设计的开源基础模型,基于全球 45+ 交易所数据预训练,能处理高噪声的金融数据。

为你而选: 适合量化研究者和金融数据分析师。开发者可用它快速进行 K 线预测、微调自有数据集,普通人也能通过 Demo 直观感受加密货币走势预测。

Kronos 把金融市场的 K 线(OHLCV 数据)当成一种“语言”来理解。作为首个开源的金融 K 线基础模型,它基于全球 45+ 交易所的数据进行预训练,专门针对金融数据高噪声、多维度的特性设计。

核心亮点与技术思路
Kronos 采用两阶段框架:先用专门的 Tokenizer 将连续的 K 线数据量化为分层离散 Token,再用自回归 Transformer 在这些 Token 上进行预训练。这种思路借鉴了自然语言处理,让模型能统一处理多种量化任务。项目开源了从 4.1M 到 102.3M 参数的多个模型版本,满足不同算力需求。

快速上手
安装依赖只需 pip install -r requirements.txt。预测过程非常简洁,通过 KronosPredictor 类即可完成数据预处理、归一化和预测。只需准备包含 open, high, low, close 等列的 pandas DataFrame,调用 predict 方法即可输出未来时间段的预测结果。项目还提供了 predict_batch 方法支持多时间序列并行预测。

微调与适用边界
项目提供了基于 Qlib 的微调流水线,支持在自有数据(如 A 股市场)上微调 Tokenizer 和 Predictor。不过,README 明确指出这只是一个演示流程,并非生产级量化交易系统。稳健的量化策略仍需结合组合优化和风险因子中性化等复杂技术。此外,使用时需注意 small 和 base 模型的最大上下文长度为 512,输入数据长度不宜超过此限制。


4. hugohe3/ppt-master

  • 作者: hugohe3
  • 语言: Python
  • ⭐ 星标: 45,540(今日 +476) | 🍴 Fork: 3,713
  • 许可证:MIT | 主页:https://hugohe3.github.io/ppt-master/
  • 标签: ai-agent, aippt, office, powerpoint, powerpoint-generation, ppt, pptx, presentation, slide, slides

项目定位: PPT Master 是一个开源工作流,让 AI 将文档或主题直接转化为原生可编辑的 PowerPoint,包含原生形状、图表、动画与音频旁白。

为你而选: 适合需要快速制作高质量 PPT 的职场人士和开发者;无需写代码,本地运行保护数据隐私,极大提升演示文稿制作效率。

PPT Master 解决了一个长期痛点:以往 AI 生成的 PPT 往往只是静态图片或死板的文本框,无法在 PowerPoint 中继续深度编辑。它直接生成符合 PowerPoint 原生对象模型的 .pptx 文件,包含可调整的原生形状、数据驱动的图表与表格,甚至支持幻灯片母版(p:sldMaster / p:sldLayout)继承。这意味着你拿到手的是一个“活”的 PPT,可以无缝继续打磨。

实现思路上,它作为一个“技能”运行在任何支持 Agent 的 AI 工具中。你只需在对话中下达指令,工作流就会在你的本地机器上执行,数据不离开本地,也没有平台或模型锁定。

快速上手非常简单,无需写代码,只需三步:安装 Python、安装一个支持 Agent 的 AI 工具(如 Claude Code),然后把你的源材料(如 PDF 或网页)丢给它即可。除了从零生成,它还能提炼现有模板风格、给已完成的 PPT 添加过渡动画和音频旁白。

需要注意的是,它目前刻意省略了 SmartArt 功能,且生成质量依赖于所使用的 AI 模型能力。项目完全免费开源,唯一的成本是调用 AI 模型的 API 费用。


5. infiniflow/ragflow

  • 作者: infiniflow
  • 语言: Go
  • ⭐ 星标: 87,534(今日 +139) | 🍴 Fork: 10,309
  • 许可证:Apache-2.0 | 主页:https://ragflow.io
  • 标签: agent-harness, agentic-ai, agentic-retrieval, agentic-search, ai, ai-agents, context-engine, context-engineering, context-management, harness-engineering, knowledge-compilation, llm-apps, rag, retrieval-augmented-generation

项目定位: RAGFlow 是一款开源的检索增强生成(RAG)引擎,融合深度文档理解与 Agent 能力,为大语言模型提供高质量的上下文层。

为你而选: 适合需要处理复杂格式文档的企业和开发者。普通人可用它搭建私有知识库,让 AI 基于真实文档精准回答,大幅减少幻觉。

如果你想让大语言模型基于你自己的文档库来回答问题,而不是凭空捏造,RAGFlow 是一个值得关注的解决方案。它解决的核心痛点是:如何把格式复杂的非结构化数据(Word、PPT、Excel、扫描件等)精准地喂给大模型,并给出可追溯的引用。

核心亮点
深度文档理解:不是简单粗暴地按字数切块,而是基于模板的智能分块,支持可视化干预,确保“垃圾进,垃圾出”不会发生。
多源兼容:从本地文件到 Confluence、Notion、S3 等云端数据,都能自动同步。
Agent 与工作流:支持编排式的数据接入管道,内置 Python/JS 代码执行器,还能对接飞书、Discord 等聊天渠道。

技术看点
默认使用 Elasticsearch 做全文和向量存储,也可以切换为官方自研的 Infinity 数据库。系统通过 Docker Compose 编排,后端配置模板化,方便环境变量注入。

快速上手
硬件门槛不算低:至少 4 核 CPU、16GB 内存和 50GB 磁盘。准备好环境后,拉取代码并启动即可:

git clone https://github.com/infiniflow/ragflow.git
cd ragflow/docker
git checkout v0.26.4
docker compose -f docker-compose.yml up -d

启动后访问服务器 IP(默认 80 端口),在配置文件中填入你的 LLM API Key 就能开箱即用。

注意事项
目前官方 Docker 镜像仅提供 x86 版本,ARM64 用户需要自行构建镜像。此外,如果需要使用代码执行沙箱功能,还需额外安装 gVisor。


6. NVIDIA-NeMo/Switchyard

  • 作者: NVIDIA-NeMo
  • 语言: Rust
  • ⭐ 星标: 813(今日 +421) | 🍴 Fork: 83
  • 许可证:Apache-2.0

项目定位: Switchyard 是一个用 Rust 编写的 LLM 流量代理与库,负责跨提供商路由请求,并在 OpenAI 和 Anthropic API 间进行协议翻译。

为你而选: 适合开发者和 AI 应用构建者。它能让 Claude Code 等编程代理直接调用开源模型,或实现多模型 A/B 测试与智能路由。

如果你用过 Claude Code 或 Codex CLI,可能会想:能不能让这些为特定 API 设计的智能体,去调用本地或开源的大模型?Switchyard 就是来解决这个问题的。它是一个用 Rust 编写的 LLM 流量代理和库,核心能力是协议翻译和多后端路由。

核心特性与实现思路
Switchyard 能在 OpenAI Chat、Anthropic Messages 和 OpenAI Responses 三种 API 格式之间无缝转换。这意味着你的客户端可以继续用原生 API 格式发请求,Switchyard 会自动把它翻译成后端模型(如 vLLM、NVIDIA NIM、Ollama 等)所需的格式,再把响应翻译回来。
在路由方面,它不仅支持随机分流做 A/B 测试,还内置了 LLM 分类器路由和信号驱动的阶段路由——比如先用弱模型回答,再由判断器决定是否升级到强模型,从而平衡成本与效果。同时,它通过 Prometheus 提供请求、延迟等运维指标。

快速上手
项目提供了三种使用路径:
1. Launcher 路径:通过 uv tool install --python 3.10 "nemo-switchyard[cli]" 安装,然后直接用 switchyard launch claude --model switchyard 启动编程代理。
2. Server 路径:通过 cargo install --locked switchyard-server 安装独立代理,配置 routes.toml 后运行。
3. Library 路径:作为 Rust 库嵌入到你自己的应用中,只负责路由决策,不接管 HTTP 调用。

注意事项
需要注意的是,Switchyard 目前处于 pre-alpha 阶段,API 变动频繁,官方明确警告暂不可用于生产环境。如果你正在寻找一种灵活连接不同大模型 API 的实验性工具,它非常值得尝试。


7. ZuodaoTech/everyone-can-use-english

  • 作者: ZuodaoTech
  • 语言: TypeScript
  • ⭐ 星标: 36,056(今日 +86) | 🍴 Fork: 5,027
  • 许可证:GPL-3.0 | 主页:https://1000h.org

项目定位: Enjoy 是一款以 AI 为核心的外语学习助教,通过网页版和浏览器插件帮助用户在真实语境中练习英语。

为你而选: 适合想提升英语听说能力的普通人;可在看 YouTube/Netflix 或读电子书时获得 AI 辅助训练,把日常输入变成高效学习。

AI 时代的外语学习新姿势

这个项目叫「人人都能用英语」,核心产品是名为 Enjoy 的应用。它的定位很明确:既然 AI 是当今最好的外语老师,那 Enjoy 就来做这个老师最好的助教。

它解决了什么问题?
传统英语学习往往脱离真实语境,背单词、刷题多,但真正去听、去说的机会少。Enjoy 把学习过程嵌进了你本来就在做的事情里——看 YouTube、刷 Netflix、读英文电子书。它提供网页版和 Chrome 浏览器插件,让你在看视频或阅读时,直接获得 AI 辅助,比如语音塑造、生词闪卡等。

核心特性与上手
多端可用:目前可以直接访问 enjoy.bot 使用网页版;Chrome 插件已上线,支持 YouTube 和 Netflix。
配套方法论:项目不仅给工具,还附带了完整的「一千小时」训练任务和《人人都能用英语》原书章节,从语音塑造到自我训练都有详细文档。
桌面版:即将发布,本质上是网页版的套壳增强。

注意事项
桌面版目前还在路上,现阶段主要依赖网页版和浏览器插件。如果在使用中遇到问题,可以查阅项目文档里的 FAQ。如果你一直觉得学英语缺乏真实场景和即时反馈,Enjoy 提供了一个把日常娱乐转化为学习输入的务实方案。


8. smicallef/spiderfoot

  • 作者: smicallef
  • 语言: Python
  • ⭐ 星标: 20,339(今日 +74) | 🍴 Fork: 3,298
  • 许可证:MIT | 主页:http://www.spiderfoot.net
  • 标签: attacksurface, cti, cybersecurity, footprinting, hacking, information-gathering, information-security, infosec, intelligence-gathering, osint, osint-framework, osint-reconnaissance, osint-tool, pentesting, python, recon, security-tools, threat-intelligence, threatintel

项目定位: SpiderFoot 是一个开源 OSINT 自动化工具,集成 200+ 模块,自动从互联网各数据源收集情报,用于威胁情报和攻击面测绘。

为你而选: 适合安全研究人员、红蓝团队、渗透测试者;普通人可用来检查自己暴露在网上的信息,开发者可二次开发模块。

SpiderFoot:把”全网搜你”这件事自动化了

做安全研究或渗透测试时,最耗时的环节往往是侦察——你要查域名、查子域、查 IP 归属、查泄露数据、查社交媒体账号、查暗网……手动一个个去搜,既慢又容易漏。SpiderFoot 把这件事变成了一个自动化流水线。

它解决了什么

核心思路是 publisher/subscriber 模型:200 多个模块互相喂数据,一个模块发现的新线索会自动触发其他模块继续深挖。比如扫到一个域名,会自动去查它的子域、DNS 记录、SSL 证书历史、关联 IP、S3 存储桶、社交媒体账号等,层层递进,最大化数据提取。

支持的目标类型很广:IP、域名、子网、ASN、邮箱、电话、用户名、人名、比特币地址都能作为扫描入口。

技术看点

  • Python 3.7+,MIT 许可,内嵌 Web 服务器,提供干净的 Web UI,也支持纯命令行使用
  • YAML 可配置的关联引擎,内置 37 条预定义规则,可以自己写规则做数据关联分析
  • SQLite 后端,方便自定义查询
  • TOR 集成,支持暗网搜索
  • 大部分模块不需要 API key,需要的也多有免费层
  • 还能调用 Nmap、DNSTwist、Whatweb 等外部工具

快速上手

wget https://github.com/smicallef/spiderfoot/archive/v4.0.tar.gz
tar zxvf v4.0.tar.gz
cd spiderfoot-4.0
pip3 install -r requirements.txt
python3 ./sf.py -l 127.0.0.1:5001

然后浏览器打开 127.0.0.1:5001 就能用了。也支持 Docker 部署。

注意事项

  • 建议用打包的稳定版(v4.0),master 分支可能有未充分测试的新功能
  • 部分模块需要配置第三方 API key(如 SHODAN、HaveIBeenPwned 等),但大多有免费额度
  • 项目自 2012 年持续维护至今,社区活跃,有 Discord 可交流
  • 商业版 SpiderFoot HX 提供云端托管、多用户协作、攻击面监控告警等增强功能,开源版不含这些

简单说,如果你需要”给一个目标,自动把互联网上能查到的相关信息尽量挖出来”,SpiderFoot 是目前最全面的开源选择之一。


9. localsend/localsend

  • 作者: localsend
  • 语言: Dart
  • ⭐ 星标: 87,799(今日 +213) | 🍴 Fork: 4,870
  • 许可证:Apache-2.0 | 主页:https://localsend.org
  • 标签: dart, file-sharing, flutter, flutter-apps

项目定位: LocalSend 是一款开源、跨平台的文件与消息共享应用,无需互联网连接即可在局域网内安全传输,是 AirDrop 的优秀替代方案。

为你而选: 适合需要在多设备间频繁传文件的普通用户和开发者;能跨系统无缝传输,摆脱数据线和网络限制,提升日常办公效率。

LocalSend 解决了一个日常痛点:跨操作系统的设备之间如何快速、安全地传文件。苹果有 AirDrop,但 Windows、Android 和 Linux 用户往往只能依赖聊天软件、网盘或数据线。LocalSend 填补了这个空白,它完全免费、开源,且不依赖任何外部服务器或互联网连接,只要设备在同一个局域网下就能互相发现并传输。

在技术实现上,它通过 REST API 进行通信,所有数据都经过 HTTPS 加密,TLS/SSL 证书在每台设备上即时生成,保证了传输的安全性。项目使用 Flutter 和 Rust 构建,这也是它能轻松覆盖 Windows、macOS、Linux、Android、iOS 甚至 Fire OS 的基础。

上手非常简单,普通用户直接从各平台的应用商店(如 App Store、Play Store、Winget 等)下载安装即可。对于想从源码编译的开发者,只需安装 Flutter 和 Rust,克隆仓库后进入 app 目录,依次执行 flutter pub getflutter run 即可启动。

需要注意的是,如果遇到设备无法发现彼此,通常是防火墙或路由器设置问题。你需要确保防火墙放行 53317 端口(TCP/UDP),并在路由器上关闭 AP 隔离。Windows 用户需将网络类型设为“专用”,而 macOS 和 iOS 用户则需在系统设置中授予“本地网络”权限。


10. Lightricks/LTX-2

  • 作者: Lightricks
  • 语言: Python
  • ⭐ 星标: 8,701(今日 +65) | 🍴 Fork: 1,396
  • 主页:https://ltx.io
  • 标签: generative-ai, ltx, ltx-2

项目定位: 首个基于 DiT 的音视频基础模型,在一个模型内集成同步音视频生成、高保真输出、多种性能模式与生产级管线,支持开放访问与 API。

为你而选: 适合视频创作者、AI 开发者和研究者。用一段文字提示直接生成带同步音频的视频,或做图生视频、音频驱动视频、视频重绘、HDR 输出等,大幅降低音视频创作门槛。

LTX-2:一个模型搞定”带声音的视频”

大多数视频生成模型只出画面不出声,LTX-2 的核心突破在于把同步音频视频生成塞进了同一个 DiT 基础模型。你给一段文字描述,它直接吐出一个有画面、有对白、有环境音的 MP4——不需要后期对口型,也不需要额外接 TTS。

它能做什么

README 列出了十几种管线,覆盖面相当广:

  • DistilledPipeline:8 步快速出片,适合快速预览;
  • DFRPipeline:细节保真渲染,生成关键帧后做空间细节增强,可选 2x/4x 时间域精修;
  • TI2VidTwoStagesPipeline:生产级文/图生视频,带 2x 上采样;
  • A2VidPipelineTwoStage:用一段音频驱动视频生成;
  • DubItPipeline:改写台词同时匹配说话人身份和口型;
  • RetakePipeline:只重做视频里某一段,其余保留;
  • HDRICLoraPipeline:输出线性 float HDR,可导出 EXR 做色调映射。

技术看点

模型权重按组件拆分(transformer、text encoder、video VAE、audio VAE、上采样器等),你只下载管线需要的部分,Quick Start 全量约 66 GiB。文本编码器用的是为 LTX 微调过的 Gemma 4 12B,版本校验严格,Google 原版 Gemma 不能替代。Video VAE 有两种解码器可选:基于 neighborhood attention 的扩散解码器(画质更好,需 natten 后端,仅 Linux+CUDA)和轻量卷积解码器(无额外依赖)。

快速上手

git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
uv sync --extra natten
hf download Lightricks/LTX-2.5 \
    diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \
    text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \
    vae/ltx-2.5-video-vae-bf16.safetensors \
    vae/ltx-2.5-audio-vae-bf16.safetensors \
    latent_upscale_models/ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors \
    --local-dir models/ltx-2.5

然后用 uv run python -m ltx_pipelines.distilled 配上模型路径和 prompt 即可生成。下载前需在 HuggingFace 接受模型条款并用 Read token 登录。

注意事项

  • 模型约 66 GiB,磁盘和带宽要留够;
  • 显存吃紧时可加 --quantization fp8-cast --offload {cpu, disk} 降负载,Hopper+ GPU 还可用 fp8-scaled-mm 做原生 FP8 矩阵乘;
  • natten 后端仅限 Linux+CUDA,Windows/macOS 会自动回退到 Triton 或 eager 实现,命令通用;
  • LTX-2.3 和 2.5 的权重文件不互通,LoRA 也只对训练时的模型版本有效。

11. embabel/embabel-agent

  • 作者: embabel
  • 语言: Kotlin
  • ⭐ 星标: 4,219(今日 +40) | 🍴 Fork: 411
  • 许可证:Apache-2.0 | 主页:https://hub.embabel.com
  • 标签: agent, agentic-ai, agents, ai, ai-agents, aiagentframework, genai, generative-ai, java, kotlin, llms, multi-agents, multi-agents-orchestration, multi-agents-system, spring

项目定位: Embabel Agent 是一个面向 JVM 的智能体框架,由 Spring 创始人打造,将 LLM 交互与代码和领域模型无缝融合,支持动态规划以实现复杂目标。

为你而选: 适合 Java/Kotlin 开发者及企业级应用团队,能用来构建可测试、可扩展且能自主规划的 AI 智能体应用。

Embabel Agent Framework 想解决的问题是:在 JVM 生态里,如何优雅地把大语言模型(LLM)的能力和传统的业务代码、领域模型结合起来,构建出真正能“自主规划”的智能体(Agent)。

它的核心亮点在于动态规划。不同于传统的有限状态机或简单的顺序执行,Embabel 引入了真正的规划步骤,默认使用 GOAP(目标导向动作规划)算法。这意味着系统可以根据当前状态和目标,动态组合已知的动作步骤,甚至执行开发者未曾预想过的路径。每执行完一个动作,系统都会重新评估和规划,形成一个 OODA 循环。

在技术实现上,它基于 Spring 和 JVM,用 Kotlin 编写但对 Java 非常友好。你可以用类似 Spring MVC 的注解模型(@Agent@Action@Goal)来定义智能体,享受强类型和依赖注入的好处,告别魔法 Map。它还支持混合不同的 LLM,方便在成本和能力之间取得平衡。

快速上手很简单:通过官方提供的 Java 或 Kotlin GitHub 模板创建仓库,配置好 OPENAI_API_KEY 并安装 Maven,不到一分钟就能跑起来一个 Agent。

需要注意的是,它目前处于活跃迭代阶段,“开放模式”(Open mode)虽然最强大但也最不确定。如果你需要在企业级环境里构建可测试、可扩展的 AI 应用,Embabel 提供了一个很有潜力的 JVM 原生选择。


12. cactus-compute/needle

  • 作者: cactus-compute
  • 语言: Python
  • ⭐ 星标: 4,210(今日 +315) | 🍴 Fork: 303
  • 许可证:MIT | 主页:https://cactuscompute.com
  • 标签: cactus, gemini, gemma, llm, on-device-ai

项目定位: Needle 2 是一个专为微型设备设计的 45M 参数开源模型,以 14MB 体积实现工具调用、设备控制和结构化数据提取,运行仅需约 28MB 内存。

为你而选: 适合需要在手机、可穿戴设备或智能家居等资源受限环境中部署 AI 工具调用的开发者,能在极低内存下完成结构化提取和设备控制。

Needle 2 解决了一个很实际的问题:如何在手机、可穿戴设备或智能家居这类资源受限的硬件上,跑起一个能听懂指令、会调用工具的 AI 模型。它把一个 45M 参数的模型压成了 14MB 的单文件,运行时只吃约 28MB 内存,却能在基准测试中和比它大 5 到 70 倍的模型掰手腕。

它的核心亮点在于“把一切问题都当函数调用来解”。你定义好工具(比如查天气、调温控),模型就只输出符合 JSON Schema 的结构化数据,字节级语法约束保证了它永远不会生成格式错误的 JSON。如果输入超出了工具的能力范围,它会直接返回空调用,而不是瞎编一段话。每个响应还自带置信度分数,你可以设个阈值,分数高的直接执行,分数低的转给更大的模型或人工处理。

技术上,它基于自研的 Simple Attention Network,用 CQ2-bit 量化把权重和引擎打包在一起,推理时完全不需要联网。内存控制也很巧妙:用 256-token 的滑动窗口加上工具 KV 固定,对话再长内存也不膨胀。

上手非常简单,pip install cactus-needle 装好后,用 @needle.tool 装饰器定义你的函数,写好 docstring,然后 agent.run("你的问题") 就能跑通整个调用闭环。它还支持用 LoRA 做微调,合并后导出依然是单个 .cact 文件,部署体验非常干净。需要注意的是,它没有自由文本回退机制,系统提示也只能用来声明环境事实(比如日期、设备状态),不能用来下达指令。


感谢阅读!如有疑问请留言
上一篇