用单张图片生成带材质3D模型,降低3D创作门槛(GitHub Trending)

今日 GitHub 热门项目 Top 11,已为你深度翻译整理。


1. usekaneo/kaneo

  • 作者: usekaneo
  • 语言: TypeScript
  • ⭐ 星标: 5,476(今日 +778) | 🍴 Fork: 473
  • 许可证:MIT | 主页:https://kaneo.app/
  • 标签: hacktoberfest, hono, issue-management, issue-tracker, jira-alternative, kanban, linear-alternative, project-management, react, self-hosted, typescript

项目定位: Kaneo 是一个开源、可自托管的项目管理工具,主打极简设计,只保留真正有用的功能,让团队专注工作本身。

为你而选: 适合厌倦了臃肿项目管理工具的团队和开发者,可自托管保护数据隐私,提升日常协作效率。

如果你曾被各种项目管理工具里繁杂的按钮和通知搞得心烦意乱,Kaneo 可能正是你想要的。它的核心理念是“少即是多”——不堆砌花哨的功能,只保留真正能解决实际问题的特性,让团队把精力放回“打造好产品”本身。

核心亮点
极简且快速:界面干净,专注于你的工作内容,而不是工具本身,同时非常注重性能体验。
开源与自托管:采用宽松的 MIT 协议,支持自托管,确保数据完全掌握在自己手中。

部署与上手
Kaneo 提供了多种部署方式,对新手非常友好:
1. 一键部署:官方推荐使用 drim CLI 工具,只需两行命令即可自动配置 HTTPS 和数据库:
bash
curl -fsSL https://assets.kaneo.app/install.sh | sh
drim setup

2. Docker Compose:最快体验方式,配置好 compose.yml.env 文件(需设置 KANEO_CLIENT_URLPOSTGRES_PASSWORDAUTH_SECRET),运行 docker compose up -d 即可在 http://localhost:5173 访问。
3. Kubernetes:如果你在用 K8s,官方也提供了完善的 Helm chart。

开发与注意事项
如果你想参与贡献或本地开发,项目使用 pnpm 管理依赖,克隆仓库后执行 pnpm install 并配置好 .env,即可通过 pnpm dev 启动开发服务器。
需要注意的是,Kaneo 依赖 PostgreSQL(如 16-alpine),并且需要配置一系列环境变量。在非 Docker 部署或高级配置场景下,务必参考官方文档仔细设置 DATABASE_URL 等参数,以免遇到连接或跨域问题。


2. zhaoxuya520/reverse-skill

  • 作者: zhaoxuya520
  • 语言: PowerShell
  • ⭐ 星标: 11,536(今日 +1,360) | 🍴 Fork: 1,754
  • 许可证:MIT

项目定位: 为 AI 编码助手打造的网络安全技能路由包,让 Claude Code、Cursor 等客户端在遇到逆向、渗透、CTF 任务时自动路由到正确方法论并按需启动工具链,而非盲目猜命令。

为你而选: 适合安全研究员、渗透测试工程师和 CTF 选手;配合 AI 编码客户端使用,可显著减少工具选型和流程编排的时间,把经验沉淀为可复用知识库。

为什么需要 reverse-skill

做安全研究的人都有过这种体验:面对一个 APK 或一段加密的前端 JS,脑子里知道大概要用 jadx、Frida 或 BurpSuite,但具体先做什么、后做什么、工具之间怎么衔接,往往靠经验甚至临场发挥。更麻烦的是,当你让 AI 助手来帮忙时,它可能连该选哪个工具都判断不准。

reverse-skill 解决的就是这个问题。它本质上是一套技能路由包——当 AI agent(Claude Code、Cursor、Cline 等)遇到逆向、渗透或 CTF 任务时,不再盲目猜测命令,而是按照预设的路由规则,先判断场景类型,再检查本地可用工具,最后执行一套可重复的工作流。

核心特性

  • 场景覆盖广:从 APK/iOS 逆向、二进制分析(IDA/radare2/Ghidra)、前端 JS 加密、.NET 逆向,到渗透测试、恶意软件分析、固件安全、CTF(40+ 子技能)、Pwn 开发、EDR 绕过、LLM 安全等,几乎覆盖了主流安全研究方向。
  • 流程规范化:通过 RULES.md 做全局路由,MASTER-ROUTING.md 提供快速分流阶梯,case-init 脚本初始化案件目录(scope/timeline/workitems),形成”证据→发现→路径→报告”的完整链路。
  • 工具索引自举:克隆仓库后运行刷新脚本即可扫描本地已安装的工具,生成 tool-index.md,AI agent 据此判断哪些工具可用、哪些需要补装。

技术栈与实现思路

项目本身不重造工具,而是做编排层。底层依赖 Java(jadx/apktool)、Node.js 22.12+(JS 工具链和 MCP 服务器)、Python 3.x(Frida 和辅助脚本),以及 IDA Pro、radare2、Ghidra 等专业工具。路由逻辑用 Markdown 规则 + PowerShell/Bash 脚本实现,轻量且可读。

快速上手

git clone https://github.com/zhaoxuya520/reverse-skill.git

然后按平台刷新工具索引:

平台 命令
Windows powershell -File skills/scripts/refresh-tool-index.ps1
Linux/macOS bash skills/scripts/refresh-tool-index.sh
Kali Linux bash kali/scripts/refresh-tool-index.sh

刷新后查看 skills/tool-index.md 确认检测到的工具。如果你是 AI agent,项目还专门提供了 README_AI.md 作为引导入口。

注意事项

  • 许可证以 MIT 为主,但 CTF-Sandbox-Orchestrator/ 子模块为 GPLv3,Pentest Swarm AI 原项目为 AGPL-3.0(本仓库仅通过 CLI/MCP 调用,不含源码)。
  • 项目定位为授权渗透测试和安全研究,使用前请确保你有合法授权。
  • 工具链依赖较多,建议在 Kali Linux 环境下使用,平台适配文档最为完整。

3. microsoft/generative-ai-for-beginners

  • 作者: microsoft
  • 语言: Jupyter Notebook
  • ⭐ 星标: 113,982(今日 +104) | 🍴 Fork: 61,185
  • 许可证:MIT
  • 标签: ai, azure, chatgpt, dall-e, generative-ai, generativeai, gpt, language-model, llms, microsoft-for-beginners, openai, prompt-engineering, semantic-search, transformers

项目定位: 微软出品的生成式AI入门课程,通过21节课系统讲解如何构建生成式AI应用。

为你而选: 适合想入门AI开发的初学者和开发者,能帮助他们从零开始掌握并动手构建AI应用。

微软的21节开源课程是生成式AI入门的好起点,系统梳理了从概念到应用开发的全流程。

课程分两类。前者讲透大模型原理与提示词工程,后者带你用 Python 或 TypeScript 写代码,构建聊天、搜索及图像生成应用。每节课配有视频、文档和代码,并提供简体中文支持。

技术栈支持 Azure OpenAI、OpenAI API 及 Foundry Models,还能用 Foundry Local 离线运行。

快速上手:因含50多种语言翻译,推荐用 sparse checkout 加速下载:

git clone --filter=blob:none --sparse https://github.com/microsoft/generative-ai-for-beginners.git

随后进入目录执行 git sparse-checkout set --no-cone '/*' '!translations' '!translated_images'。运行需 GitHub 账号及基础 Python/TS 知识。

注意:零编程基础较吃力。调用云端 API 可能产生费用,预算敏感者可用 Foundry Local 离线方案。


4. github/copilot-sdk

  • 作者: github
  • 语言: Java
  • ⭐ 星标: 10,219(今日 +145) | 🍴 Fork: 1,382
  • 许可证:MIT

项目定位: GitHub Copilot SDK 是一套多平台开发工具包,将 Copilot CLI 背后的成熟 Agent 运行时直接嵌入你的应用,省去自建编排逻辑的麻烦。

为你而选: 适合需要在应用中集成 AI Agent 的开发者。你可以用它快速实现规划、工具调用和文件编辑,无需从零搭建复杂的工作流。

以前要在自己的应用里搞一个能自主规划、调用工具、改文件的 AI Agent,你得自己写一堆编排逻辑。GitHub Copilot SDK 直接把 Copilot CLI 背后那套经过生产检验的 Agent 运行时打包成了多语言 SDK,让你能以编程方式调用,省去了重复造轮子的麻烦。

在技术实现上,它支持 Python、TypeScript、Go、.NET、Java 和 Rust 六种主流语言。底层架构很清晰:你的应用通过 SDK 客户端,以 JSON-RPC 协议与 Copilot CLI(服务器模式)通信。SDK 会自动管理 CLI 进程的生命周期,开发者无需操心底层进程的启停。

快速上手也很直接。比如 Python 环境只需 pip install github-copilot-sdk,Node.js 用 npm install @github/copilot-sdk。对于 Node.js、Python 和 .NET,CLI 会作为依赖自动捆绑;而 Go、Java 和 Rust 则需要你手动确保 copilot 命令在系统 PATH 中。

有几个边界需要注意:标准使用需要 GitHub Copilot 订阅,且每次 prompt 都会计入使用额度。不过它也支持 BYOK(自带密钥),你可以配置 OpenAI 或 Anthropic 等提供商的 API Key 来绕过 GitHub 认证。默认情况下它会开启 CLI 的第一方工具,但你可以通过 SDK 的权限处理器来批准、拒绝或自定义这些工具调用,核心控制权依然在开发者手里。


5. github/gh-stack

  • 作者: github
  • 语言: Go
  • ⭐ 星标: 726(今日 +67) | 🍴 Fork: 32
  • 许可证:MIT | 主页:https://gh.io/stacks
  • 标签: cli, gh-extension, github, stacked-prs

项目定位: 一个 GitHub CLI 扩展,用于管理堆叠分支和拉取请求,将大型代码变更拆分为一系列小而可审查的 PR 链,并自动化分支创建、rebase 和 PR 基底设置等繁琐操作。

为你而选: 适合需要处理大型代码重构或复杂功能的开发团队。它能帮你把巨型 PR 拆成易读的小 PR,提升代码审查效率,并大幅降低维护多分支的心智负担。

把巨型 PR 拆成乐高积木:gh-stack

在协作开发中,动辄上千行的巨型 PR 往往让审查者望而生畏。gh-stack 是 GitHub 官方推出的一个 CLI 扩展,它通过“堆叠 PR(Stacked PRs)”的理念,把庞大的代码变更拆解成一条环环相扣的小 PR 链。每个 PR 只包含一层的改动,审查者每次只需关注局部逻辑,极大降低了审查难度。

核心亮点
自动化繁琐操作:从创建分支、级联 rebase 到自动设置正确的 PR 基分支,gh stack 都能一键搞定。你不再需要手动维护分支间的依赖关系。
直观的结构调整:通过 gh stack modify 提供的终端 UI,你可以像拼积木一样对分支进行折叠、插入、重排或重命名,所有操作预览后一键生效。
AI 协作友好:支持安装 gh skill,让你的 AI 编程助手也能理解并操作堆叠 PR,进一步解放双手。

快速上手
只需安装 GitHub CLI (v2.0+),然后运行:

gh extension install github/gh-stack

初始化一个堆栈只需 gh stack init,接着用 gh stack add 不断叠加新分支,最后用 gh stack submit 一键在 GitHub 上生成相互关联的 PR 链。

注意事项
堆叠 PR 的元数据保存在本地的 .git/gh-stack 文件中(不提交到仓库)。当本地与远程的堆栈结构发生分歧时,工具会提示你进行手动干预,确保不会静默丢失代码。如果你正被大型重构的 PR 审查折磨,这个工具绝对值得一试。


6. abus-aikorea/voice-pro

  • 作者: abus-aikorea
  • 语言: Python
  • ⭐ 星标: 11,596(今日 +53) | 🍴 Fork: 1,705
  • 许可证:GPL-3.0 | 主页:https://www.wctokyoseoul.com
  • 标签: audiobook, faster-whisper, gradio, karaoke, podcasts, speech-recognition, speech-synthesis, speech-to-text, subtitles, text-to-speech, transcription, translator, tts, voice-cloning, voice-conversion, webui, whisper, whisperx, yt-dlp

项目定位: Voice-Pro 是一款集成了语音识别、翻译、多语言配音和零样本语音克隆的 AI Web 应用,为创作者和开发者提供强大的多媒体内容处理能力。

为你而选: 适合播客创作者、开发者和多语言工作者。普通人可用它下载YouTube视频、分离人声、生成多语言配音,实现以往需昂贵商业服务才能完成的任务。

Voice-Pro 把 YouTube 视频下载、人声分离、语音识别、翻译和文本转语音(TTS)整合在了一个 Gradio WebUI 里。它最大的亮点在于支持零样本语音克隆(F5-TTS、E2-TTS、CosyVoice),并且集成了 Whisper 系列的语音识别和 100 多种语言的即时翻译,可以看作是 ElevenLabs 的一个免费开源替代方案。

从技术栈来看,v4.0 版本有不少值得关注的改进。项目将安装器迁移到了 uv,大幅提升了安装速度和环境的可复现性;运行时升级到了 Python 3.12、Torch 2.8.0+cu128(支持 RTX 50 系列显卡)和 Gradio 6。对普通用户更友好的是,它不再需要安装 CUDA Toolkit 和 Visual Studio Build Tools,所有依赖都打包了预构建的 wheels,甚至在受限的企业电脑上也无需管理员权限即可运行。

快速上手
在 Windows 环境下,只需运行 start.bat,程序会自动下载便携版 ffmpeg 和所需的 AI 模型。如果遇到报错,通常只需删除 installer_files 文件夹后重新运行 start.bat 即可,已下载的模型会保留在 model/ 目录中,重装只需几分钟。

注意事项
项目目前主要在配备 NVIDIA GPU 的 Windows 上运行良好,Mac 和 Linux 的兼容性未经验证。此外,作者因其他项目开发原因暂停了 Voice-Pro 的更新,但已将所有代码完全开源免费,任何人都可以自由分发和修改。


7. iv-org/invidious

  • 作者: iv-org
  • 语言: Crystal
  • ⭐ 星标: 21,497(今日 +361) | 🍴 Fork: 2,426
  • 许可证:AGPL-3.0 | 主页:https://invidious.io
  • 标签: agplv3, hacktoberfest, invidious, libre, video, watch, youtube, youtube-video

项目定位: Invidious 是一个开源的 YouTube 替代前端,提供轻量、无广告、无追踪的观看体验,且不依赖官方 API。

为你而选: 适合注重隐私的普通用户和开发者。普通人可借此免广告看视频,开发者可利用其 API 二次开发或自建实例。

如果你厌倦了 YouTube 官方客户端里无处不在的广告和追踪脚本,Invidious 是一个值得尝试的开源替代前端。它通过自建或公共实例,为你呈现一个干净、轻量的视频浏览环境。

核心亮点
隐私与轻量:无广告、无追踪,甚至不需要启用 JavaScript 即可观看,同时支持明暗主题和音频模式(移动端可后台播放)。
订阅独立:你的订阅列表不再绑定 Google 账号,且支持从 YouTube、NewPipe 和 FreeTube 导入导出数据。
技术看点:它绕过了官方 YouTube API,避免了配额限制;采用 AGPLv3 协议且无 CLA,对社区贡献非常友好。

快速上手
普通用户无需部署,直接从公共实例列表选一个就能看视频。如果想自建,可以查阅官方文档的安装指南。此外,强烈推荐搭配 Privacy Redirect 浏览器扩展,它能自动把 YouTube 链接重定向到 Invidious,体验无缝切换。

注意事项
项目方声明不对第三方实例的使用承担责任,使用时请遵守所在地的法律法规,避免用于非法下载等不当用途。


8. microsoft/TRELLIS.2

  • 作者: microsoft
  • 语言: Python
  • ⭐ 星标: 9,816(今日 +167) | 🍴 Fork: 1,191
  • 许可证:MIT

项目定位: 微软开源的40亿参数图生3D大模型,采用全新O-Voxel结构,能高效生成高保真、支持复杂拓扑和PBR材质的3D资产。

为你而选: 适合3D开发者与创作者。普通人可借此从单张图片快速生成带真实材质的3D模型,大幅降低3D内容创作门槛。

TRELLIS.2 是微软开源的一款拥有 40 亿参数的大型 3D 生成模型,专注于高保真的“图生3D”任务。它解决的核心痛点在于传统 3D 生成难以处理复杂拓扑结构(如开放表面、非流形几何、内部封闭结构)以及材质表现单一的问题。

项目最大的技术亮点是提出了一种名为 O-Voxel 的无场稀疏体素结构。这种表示方法打破了等值面场的限制,实现了无需渲染、无需优化的无损转换。在单 CPU 上,网格转 O-Voxel 不到 10 秒;在 CUDA 加速下,O-Voxel 转网格不到 100 毫秒。结合稀疏 3D VAE 和原生 DiT 架构,模型在 H100 GPU 上生成 512³ 分辨率的 3D 资产仅需约 3 秒。除了几何形状,它还能生成包含基础颜色、粗糙度、金属度、不透明度等完整的 PBR 材质,支持逼真的光照渲染和透明度。

快速上手与注意事项

项目目前仅支持 Linux 系统,且需要至少 24GB 显存的 NVIDIA GPU(推荐 CUDA 12.4)。克隆代码库后,可通过官方提供的 setup.sh 脚本一键创建 conda 环境并安装复杂依赖:

git clone -b main https://github.com/microsoft/TRELLIS.2.git --recursive
cd TRELLIS.2
. ./setup.sh --new-env --basic --flash-attn --nvdiffrast --nvdiffrec --cumesh --o-voxel --flexgemm

环境就绪后,你可以直接运行 example.py 体验图生3D,或通过 python app.py 启动本地 Web 演示。生成的资产可直接导出为带 PBR 材质的 GLB 格式,方便导入主流 3D 软件使用。

需要注意的是,导出的 GLB 文件默认处于 OPAQUE(不透明)模式。虽然纹理贴图中保留了 Alpha 通道,但默认未激活。如果需要透明效果,导入 3D 软件后需手动将纹理的 Alpha 通道连接到材质的不透明度输入端。此外,由于依赖较多,安装过程可能耗时较长,遇到问题可查阅官方文档或提交 issue。


9. TencentCloud/TencentDB-Agent-Memory

  • 作者: TencentCloud
  • 语言: TypeScript
  • ⭐ 星标: 10,053(今日 +250) | 🍴 Fork: 970
  • 标签: agent, ai-agent, embedding, llm, local-first, long-term-memory, memory, openclaw-plugin, vector-search

项目定位: 腾讯云开源的团队级 AI Agent 记忆中枢,将对话、文档和代码转化为四种可复用记忆资产,让 Agent 跨框架共享经验,告别重复劳动。

为你而选: 适合开发者和 AI 应用团队。可用它为 Agent 组建团队并分配记忆,让 Agent 继承历史经验,无需每次从零开始。

如果你经常使用 AI Agent,大概会被同一个问题困扰:每次开启新会话,Agent 都得从零开始了解你的项目。TencentDB Agent Memory 就是为了解决这个“重复造轮子”的痛点而生。它把对话、文档和代码转化为四种可复用的记忆资产:Chat Memory(对话记忆)、Skill(技能库)、Wiki(知识图谱)和 CodeGraph(代码调用图),让 Agent 能够继承团队经验。

在技术实现上,它有几个值得关注的看点。首先是记忆分层(L0 到 L3),将原始对话逐层提炼为事实、场景和长期画像,检索时结合 BM25、向量检索与 RRF 算法,既精准又避免撑爆上下文窗口。其次,知识不是全量注入,而是通过工具按需调用。权限上采用 Fixed Binding + ACL 模型,支持 private、team、restricted 等可见性,确保共享经验的同时不泄露隐私。

快速上手非常简单,只需克隆仓库并运行启动脚本:

git clone https://github.com/Tencent/TencentDB-Agent-Memory.git
cd TencentDB-Agent-Memory/deploy/global-images
cp .env.example .env
$EDITOR .env
./start-all.sh

启动后访问 http://localhost:8125 即可打开控制面板。需要注意的是,运行环境要求 Node 22.16 及以上版本,且需在 .env 中配置好 LLM 参数。对于想组建多 Agent 协作团队的开发者来说,这是一个能让经验持续复利的高效工具。


10. NomaDamas/k-skill

  • 作者: NomaDamas
  • 语言: JavaScript
  • ⭐ 星标: 6,678(今日 +64) | 🍴 Fork: 790
  • 许可证:MIT | 主页:https://k-skill.nomadamas.org

项目定位: 为韩国人量身打造的 AI 代理技能合集,让 Claude Code 等编程代理能够直接处理韩国本土的 SRT、KTX、KBO、政府服务等繁琐事务。

为你而选: 适合在韩国生活或开发的人,能让 AI 代理自动完成查票、订票、查天气、查法规等日常繁琐任务,大幅提升效率。

它解决了什么问题?
在韩国,订高铁票、查棒球比分、查政府公开信息等日常事务往往需要登录各种繁杂的网站。k-skill 这个项目把所有这些繁琐的操作打包成了 AI 代理可以直接调用的“技能”,让 Claude Code、Codex 等编程代理瞬间变成懂韩国生活的“本地人”。

核心特性与亮点
项目覆盖了极其丰富的场景:从 SRT/KTX 高铁和高速巴士订票,到首尔地铁实时信息、KBO 棒球比分、甚至韩江水位查询。它还支持韩国法律检索、房产交易价格查询、企业工商信息实查等深度功能。你不需要额外编写客户端 API 层,直接通过 k-skill-proxy 发送 HTTP 请求即可。

快速上手
只要你的环境里有 Node.js 18 及以上版本和 npx,一行命令就能安装全部技能:

npx --yes skills add NomaDamas/k-skill --all -g

如果只需要某个特定技能(比如 SRT 订票),也可以单独安装:

npx --yes skills add NomaDamas/k-skill --skill srt-booking -g

适用边界与注意事项
需要注意的是,部分涉及个人隐私或资金的操作(如订票、查证券账户、打印 Hi-Pass 收据)需要用户自己提供登录凭证或手动登录;而像查询天气、交通、公开法规等技能则无需登录。项目本身只提供技能调用与信息整合,部分需要支付或提交的环节仍需人工介入。


11. bytedance/deer-flow

  • 作者: bytedance
  • 语言: Python
  • ⭐ 星标: 78,588(今日 +204) | 🍴 Fork: 10,732
  • 许可证:MIT | 主页:https://deerflow.tech
  • 标签: agent, agentic, agentic-framework, agentic-workflow, ai, ai-agents, deep-research, harness, langchain, langgraph, langmanus, llm, multi-agent, nodejs, podcast, python, superagent, typescript

项目定位: 字节跳动开源的长周期超级智能体框架,通过编排子代理、记忆和沙箱,结合可扩展技能,处理从几分钟到几小时不等的复杂任务。

为你而选: 适合需要处理深度研究、代码生成或复杂任务链的开发者。普通人可借助它自动化耗时工作流,实现从研究到创作的端到端任务执行。

DeerFlow 2.0 是字节跳动开源的一个超级智能体框架,它的核心价值在于能够处理“长周期”任务。不同于只能回答单次提问的聊天机器人,DeerFlow 可以通过编排子代理、调用长期记忆、在沙箱中执行代码,并结合可扩展的技能,完成从深度研究到代码编写和内容创作的复杂工作流。

核心特性与看点
多代理协同与沙箱:支持子代理分工,并在安全的沙箱环境中执行代码和文件操作,避免对宿主环境造成破坏。
长期记忆与上下文工程:具备长期记忆能力,支持手动上下文压缩,能在多轮交互中保持任务连贯性。
集成搜索能力:集成了 BytePlus 的 InfoQuest 智能搜索与爬虫工具集,增强了信息获取能力。
模型兼容性:不仅支持 OpenAI、DeepSeek、Kimi 等主流云端模型,还支持通过 vLLM 部署的本地模型,甚至兼容 Claude Code 和 Codex CLI 等 CLI 后端。

快速上手
项目推荐使用 Docker 进行部署。首先克隆仓库,然后运行 make setup 启动交互式配置向导,它会引导你选择 LLM 提供商、搜索工具并生成基础配置文件。配置完成后,可以通过以下命令启动:

make docker-init    # 拉取沙箱镜像
make docker-start   # 启动服务

注意事项
DeerFlow 2.0 是一次完全重写,与 1.x 版本不共享代码。在部署资源方面,官方建议长期运行的服务器至少配备 8 vCPU 和 16 GB RAM,如果同时运行本地大模型则需要更多资源。此外,由于涉及代码执行和文件系统访问,务必关注官方的安全建议,合理配置沙箱和权限。


感谢阅读!如有疑问请留言
上一篇
下一篇