GitHub Trending 日报 · 2026-07-29

GitHub Trending 日报 · 2026-07-29|pascalorg/editor 支持 WebGPU 3D 建模,huggingface/speech-to-speech 实现低延迟语音代理,affaan-m。每日精选 12 个热门开源项目,附中文深度解读、核心特性与快速上手。

今日 GitHub 热门项目 Top 12,已为你深度翻译整理。


1. pascalorg/editor

  • 作者: pascalorg
  • 语言: TypeScript
  • ⭐ 星标: 18,674(今日 +341) | 🍴 Fork: 2,526
  • 许可证:MIT | 主页:https://editor.pascal.app

项目定位: 基于 React Three Fiber 和 WebGPU 的 3D 建筑编辑器,支持创建、编辑和分享三维建筑项目,采用单体仓库架构提供核心包与编辑器应用。

核心特性:
– 节点化场景模型:扁平字典存储,通过 parentId 维护层级,支持撤销/重做与 IndexedDB 持久化
– 脏节点增量更新:仅重新计算变更节点几何体,配合系统在渲染循环中高效更新
– 插件化扩展机制:内置节点定义、渲染器、工具均以插件形式注册,支持自定义节点类型
– 空间网格管理器:提供碰撞检测、放置验证及楼板高程查询,辅助精准建模
– 分层状态管理:核心、查看器、编辑器各自拥有 Zustand store,职责清晰且可独立访问
– 事件总线通信:类型安全的事件发射器实现组件间解耦交互

适用场景:
– 建筑师快速创建三维建筑方案并协作分享
– 开发者构建自定义 3D 编辑器或集成建筑可视化功能
– 教学演示建筑空间布局与构件关系
– 室内设计师进行家具摆放与空间规划

技术亮点:
– Turborepo 单体仓库管理核心、查看器、编辑器、节点等包
– React Three Fiber + WebGPU 实现高性能三维渲染
– Zustand + Zundo 实现带持久化和时光旅行的状态管理
– three-bvh-csg 支持布尔几何运算生成墙体开洞

快速上手:
– 克隆仓库后在根目录运行 bun install 安装依赖
– 执行 bun dev 启动开发服务器(含包监听热重载),访问 http://localhost:3002
– 使用 turbo build 构建生产包,或 npm publish --workspace=@pascal-app/core --access public 发布


2. jenkinsci/jenkins

  • 作者: jenkinsci
  • 语言: Java
  • ⭐ 星标: 26,065(今日 +180) | 🍴 Fork: 9,687
  • 许可证:MIT | 主页:https://www.jenkins.io
  • 标签: cicd, continuous-delivery, continuous-deployment, continuous-integration, devops, groovy, hacktoberfest, java, jenkins, pipelines-as-code

项目定位: Jenkins 是领先的开源自动化服务器,基于 Java 构建,拥有 2000+ 插件生态,支持构建、测试、部署等全流程自动化,助力团队专注于核心开发工作。

核心特性:
– 插件生态丰富:2000+ 插件覆盖构建、测试、部署等几乎所有自动化场景
– 多平台分发:提供 WAR、Docker 镜像、原生安装包等多种部署方式
– 双发布线策略:周度版快速迭代新功能,LTS 版长期维护稳定可靠
– 流水线即代码:支持 Declarative/Scripted Pipeline 实现 CI/CD 即代码管理
– 分布式构建架构:主从节点模式实现构建任务横向扩展与资源隔离
– 活跃社区治理:开放治理模式,数百万用户与数千企业共同维护演进

适用场景:
– 持续集成/持续部署 (CI/CD) 流水线自动化
– 多语言项目的自动化构建、测试与静态分析
– 复杂部署流程的编排与多环境发布管理
– 重复性运维任务的调度与自动化执行

技术亮点:
– 核心基于 Java (JDK 11+) 构建,Servlet 容器运行 (Jetty/Tomcat)
– 插件化架构:通过扩展点机制实现核心功能与插件解耦
– Pipeline 领域特定语言 (DSL) 基于 Groovy 实现流水线即代码

快速上手:
– 访问官网下载页面获取 WAR、Docker 镜像或原生安装包
– 参考 CONTRIBUTING.md 搭建开发环境并贡献代码
– 查阅 Jenkins 开发者文档了解核心架构与插件开发


3. moeru-ai/airi

  • 作者: moeru-ai
  • 语言: TypeScript
  • ⭐ 星标: 44,736(今日 +797) | 🍴 Fork: 4,447
  • 许可证:MIT | 主页:https://airi.moeru.ai/docs/
  • 标签: ai-companion, ai-vtuber, airi, digital-life, grok-companion, live2d, neuro-sama, neurosama, openclaw, vrm, vtuber

项目定位: 自托管的AI虚拟伴侣项目,复刻Neuro-sama能力,支持实时语音聊天、Minecraft/Factorio游戏陪玩,跨平台运行。

核心特性:
– 实时语音对话,打造类Neuro-sama的赛博灵魂容器
– 支持Minecraft与Factorio游戏实况陪玩互动
– 全平台覆盖:Web/桌面端/移动端PWA无缝运行
– 桌面版原生调用CUDA/Metal,推理性能媲美原生应用
– 基于WebGPU/WebAssembly等现代Web技术栈构建
– 插件系统与Discord语音接入扩展能力持续演进

适用场景:
– 想拥有专属AI虚拟主播/陪玩的个人用户
– 二次元文化爱好者寻求赛博伙伴体验
– 开发者研究端侧多模态AI与游戏Agent结合
– 自托管隐私优先的AI伴侣应用场景

技术亮点:
– Vue.js + TypeScript + Electron桌面端架构
– WebGPU/WebAudio/WebAssembly/WebSocket全栈Web技术
– HuggingFace candle驱动原生CUDA/Metal推理加速

快速上手:
– Windows: winget install MoeruAI.AIRI 或 Scoop 安装
– macOS: brew install –cask airi
– 直接访问 https://airi.moeru.ai 体验Web版

注意事项:
– 项目处于早期开发阶段,功能与稳定性持续迭代中
– 部分高级能力(如插件系统)仍在建设中(WIP)


4. andrewyng/aisuite

  • 作者: andrewyng
  • 语言: Python
  • ⭐ 星标: 15,675(今日 +62) | 🍴 Fork: 1,656
  • 许可证:MIT

项目定位: aisuite 是一个轻量级 Python 库,提供统一的 Chat Completions API 和 Agents API,让开发者通过单一接口调用多家生成式 AI 供应商,并赋予模型工具调用与多轮任务能力。

核心特性:
– 统一 Chat Completions API:以 OpenAI 兼容格式对接 OpenAI、Anthropic、Google、Ollama 等十余家供应商,仅改模型字符串即可切换。
– Agents API 与工具包:内置文件、Git、Shell 等沙箱工具包,支持工具策略、状态持久化、产物追踪,开箱即用构建智能体。
– 原生 MCP 支持:无需样板代码即可接入任意 MCP 服务器工具,扩展模型能力边界。
– 流式与异步统一:所有支持流式的供应商共享相同迭代器接口,工具调用片段亦可增量获取。
– 供应商适配器模式:遵循命名约定即可自动发现新供应商实现,降低集成门槛。

适用场景:
– 需要在同一代码库中无缝切换多家 LLM 供应商的应用开发。
– 构建具备文件操作、代码执行、外部 API 调用等工具能力的自主智能体。
– 接入本地模型(如 Ollama)或私有化部署端点,保障数据不出本机。
– 快速原型开发桌面端 AI 协作工具(如 OpenWorker 同款架构)。

技术亮点:
– Python 轻量级库,核心依赖极少,通过适配器模式动态加载供应商 SDK。
– 遵循 OpenAI Chat Completions 规范,统一请求/响应结构与流式增量格式。
– 内置 MCP 客户端、工具审批策略、多后端状态存储(内存/文件/Postgres)等生产级组件。

快速上手:
– 安装基础包:pip install aisuite
– 安装指定供应商 SDK:pip install 'aisuite[anthropic]' 或全部:pip install 'aisuite[all]'
– 基础调用示例:client = ai.Client(); client.chat.completions.create(model="openai:gpt-4o", messages=[...])

注意事项:
– 流式工具调用为手动模式,不可与 max_turns 自动多轮循环结合使用。


5. affaan-m/ECC

  • 作者: affaan-m
  • 语言: JavaScript
  • ⭐ 星标: 234,785(今日 +636) | 🍴 Fork: 35,774
  • 许可证:MIT | 主页:https://ecc.tools
  • 标签: ai-agents, anthropic, claude, claude-code, developer-tools, llm, mcp, productivity

项目定位: ECC 是智能体工具链性能优化系统,为 Claude Code、Codex、Cursor 等 AI 编程助手提供 67 智能体、281 技能、记忆、安全扫描及持续学习,将工程流程标准化内置到智能体工作方式中。

核心特性:
– 67 个专用智能体覆盖规划、审查、构建修复、安全、架构等领域
– 281 项技能支持 TDD、研究、安全、文档、前端、数据、ML、运维等
– 内置钩子、记忆、持续学习机制,实现会话摘要、本能行为与上下文控制
– AgentShield 安全扫描检测提示词、钩子、MCP 配置、权限、密钥及智能体文件
– 支持 Claude Code、Codex、Cursor、OpenCode、Gemini、Zed、Copilot 等 10+ 工具
– 提供 94 个遗留命令简写,平滑迁移到以技能为主的交互界面

适用场景:
– AI 编程助手用户想标准化工程流程(规划→测试→实现→审查→验证→记忆→改进)
– 团队需跨多种 AI 工具统一技能与规范
– 安全敏感项目需自动扫描提示词注入、密钥泄露等风险
– 开发者希望将重复成功经验沉淀为可复用技能与工作流

技术亮点:
– 多语言实现:Shell、TypeScript、Python、Go、Java、Perl、Markdown
– npm 包分发:ecc-universal(核心)、ecc-agentshield(安全扫描)
– 插件架构适配多种智能体工具,GitHub App 同步私有仓库配置

快速上手:
– Claude Code: 在 Claude Code 中运行 /plugin marketplace add https://github.com/affaan-m/ECC 然后 /plugin install ecc@ecc
– Codex: 克隆仓库后运行 npm install && bash scripts/sync-ecc-to-codex.sh 同步配置
– 通用: git clone https://github.com/affaan-m/ECC.git 后按目标工具文档配置规则包

注意事项:
– 同一工具勿叠加多种安装方式(如 Claude Code 插件+手动安装),会导致技能、命令、钩子重复
– Codex 插件市场仍在实验阶段,共享内容可能未复制到安装缓存,建议优先用同步流程


6. huggingface/speech-to-speech

  • 作者: huggingface
  • 语言: Python
  • ⭐ 星标: 7,210(今日 +227) | 🍴 Fork: 953
  • 许可证:Apache-2.0
  • 标签: ai, assistant, language-model, machine-learning, python, speech, speech-synthesis, speech-to-text, speech-translation

项目定位: 一个低延迟、完全模块化的语音代理管道(VAD→STT→LLM→TTS),提供 OpenAI Realtime 兼容的 WebSocket API,所有组件可热插拔,支持全本地或混合部署,已在 Reachy Mini 机器人上大规模生产验证。

核心特性:
– 四阶段流水线(VAD/STT/LLM/TTS)每阶段多后端可互换,CLI 一键切换
– 原生实现 OpenAI Realtime 协议,现有客户端零改动即可接入自建服务
– 支持本地推理(Transformers、mlx-lm、llama.cpp、vLLM)与云端 API 无缝切换
– 提供 realtime/local/websocket/socket 四种运行模式,覆盖从设备端到服务端的多样部署
– 内置 Silero VAD v5 实现低延迟端点检测与打断处理,支持实时部分转录流式输出
– 多语言 TTS 矩阵:Qwen3-TTS、Kokoro、Pocket、ChatTTS、MMS 等 5+ 开源模型任选

适用场景:
– 想在自有硬件上跑完全开源的语音助手/机器人对话后端
– 需要兼容 OpenAI Realtime API 但想自主控制模型与数据隐私的应用
– 多语言、多音色的实时语音交互原型开发与生产部署
– 嵌入式/边缘设备上运行低延迟语音管道(支持 Apple Silicon MPS 与 CUDA)

技术亮点:
– Python 3.10+,多线程队列级联架构,组件解耦便于二次开发
– 核心依赖:Silero VAD v5、Parakeet TDT/Whisper 系列、Qwen3-TTS (GGML/MLX)、OpenAI 兼容协议
– 跨平台加速:CUDA、CPU、Apple Silicon (MPS/MLX) 自动适配,Docker Compose 一键起全栈

快速上手:
– pip install speech-to-speech && export OPENAI_API_KEY=… && speech-to-speech
– 客户端测试:python scripts/listen_and_play_realtime.py –host 127.0.0.1 –port 8765
– 本地 LLM 示例:llama-server -hf ggml-org/gemma-4-E4B-it-GGUF … 并指定 –responses_api_base_url http://127.0.0.1:8080/v1

注意事项:
– DeepFilterNet 需 numpy<2 与 Pocket TTS (numpy>=2) 冲突,二者不可共存
– TCP socket 模式缺少打断处理、实时转录事件、工具调用等完整 Realtime API 功能


7. virgiliojr94/book-to-skill

  • 作者: virgiliojr94
  • 语言: Python
  • ⭐ 星标: 11,319(今日 +423) | 🍴 Fork: 1,336
  • 许可证:MIT

项目定位: 将技术书籍、文档转换为结构化 Agent Skill,供 GitHub Copilot CLI、Amp、Claude Code 按需加载,实现零幻觉、低 Token 成本的知识复用。

核心特性:
– 支持 PDF/EPUB/DOCX/MD 等 10 种格式,自动选择最优提取工具(Docling 处理表格代码,pdftotext 极速处理纯文本)
– 生成标准化 Skill 目录:SKILL.md 核心模型 + 按章按需加载 + 术语表/模式/速查表,首次构建一次性付出导航成本
– 章节文件按需加载,不占常驻 Token 预算;实测单次问答 Token 消耗仅为全文塞入上下文的 1/24~1/51
– 兼容开放 Agent Skills 标准,同一份 Skill 可在 Copilot CLI、Amp、Claude Code 间通用
– 支持增量折叠:新文档可合并进现有 Skill,持续扩展知识库
– 自动识别章节结构(需显式 Chapter N 标题),生成逐章摘要、代码示例、参考表格

适用场景:
– 技术书籍学习与工作中随时查阅
– 内部架构决策、运维手册、入职文档整合
– 品牌设计系统、语调规范团队共享查询
– 论文笔记簇、RFC 标准、合规文档统一检索

技术亮点:
– Python 提取管线 + Claude 结构化分析生成
– Docling/pdftotext/ebooklib 等格式适配器链
– Agent Skills 开放标准(SKILL.md + 按需加载章节)

快速上手:
– 运行 python3 scripts/extract.py --check 一键检查缺失依赖
– 执行 /book-to-skill ./book.pdf my-skill 生成技能
– Copilot CLI 需运行 /skills reload 刷新列表

注意事项:
– 章节自动分割要求显式 ‘Chapter N’/’Capítulo N’ 标题,纯标题/罗马数字章节无法自动分段
– Discovery Loop Tax 数据为模型估算而非实测 Agent 多轮对话,且单次发现成本不随轮次复现


8. opengeos/GeoLibre

  • 作者: opengeos
  • 语言: TypeScript
  • ⭐ 星标: 3,380(今日 +607) | 🍴 Fork: 390
  • 许可证:MIT | 主页:https://geolibre.app
  • 标签: data-science, duckdb, geospatial, maplibre, maplibre-gl-js, tauri-app

项目定位: 轻量级云原生 GIS 平台,支持浏览器、桌面、移动端及 Jupyter 运行,数据本地私有。

核心特性:
– 全平台运行:Web、桌面、Android、Jupyter 统一代码库,响应式适配移动端
– 数据本地私有:无需上传云端,浏览器即可完成空间分析与可视化
– 内置 700+ GIS 工具:零安装在浏览器执行矢量、地形、时空等地理处理
– 行星级底图支持:覆盖月球、火星等 10+ 天体,椭球体自适应保证测量精度
– 3D Tiles 与 deck.gl 渲染:支持 3D 城市模型、时间滑块动态可视化
– 插件化架构:如大气效果插件提供星空背景、光晕、彗星等沉浸式体验

适用场景:
– 跨平台 GIS 数据探索与即时分析
– Jupyter 笔记本中的地理空间交互式工作流
– 行星科学制图与多天体测量分析
– 3D 城市模型时序可视化与分享

技术亮点:
– Tauri v2 + React/TypeScript 构建原生桌面/移动应用
– MapLibre GL JS + deck.gl 驱动 2D/3D 渲染
– DuckDB-WASM Spatial 实现浏览器端空间 SQL 查询

快速上手:
– 直接访问 https://web.geolibre.app/ 无需安装即可使用
– 桌面端下载:https://geolibre.app/downloads/ (Windows/macOS/Linux)
– Python 环境:pip install geolibreconda install -c conda-forge geolibre


9. paperswithbacktest/awesome-systematic-trading

  • 作者: paperswithbacktest
  • 语言: Python
  • ⭐ 星标: 9,565(今日 +309) | 🍴 Fork: 1,290
  • 主页:https://paperswithbacktest.com
  • 标签: algorithmic-trading, algotrading, alpha, arbitrage-bot, awesome, awesome-list, book, finance, futures, futures-historical-data, futures-market, futuresmarkets, paper, quant, quantitative-finance, quantitative-trading, trading-algorithms, trading-bot, trading-strategies

项目定位: 一个面向系统化/量化交易的精选资源清单,汇聚库、策略、书籍、视频等全维度资料,助力交易者快速发现工具与知识。

核心特性:
– 收录97个库/包、40+策略、55本书、23个视频及博客课程,覆盖研发到实盘全流程
– 按编程语言分类并按星标降序排列,便于技术选型与对比
– 细分事件驱动、向量化回测、加密货币、数据源、机器学习等专业领域
– 提供中文版README,降低中文用户阅读门槛
– 关联paperswithbacktest.com提供Python策略独家实现内容

适用场景:
– 量化初学者系统性入门学习资源
– 策略研究者查找学术/机构公开策略
– 开发者对比选型回测框架与数据工具
– 加密货币交易者寻找现成交易机器人

技术亮点:
– 涵盖Python、C++、Go、Rust等多语言生态
– 包含事件驱动与向量化两大回测架构范式
– 部分高性能库采用Numba/JIT加速计算

快速上手:
– 直接访问GitHub仓库浏览分类资源表格
– 阅读README_zh.md获取中文导航
– 访问paperswithbacktest.com查看Python策略实现

注意事项:
– 部分收录项目标注为旧且不再维护
– 资源质量需自行甄别,列表不提供可直接运行的代码或环境


10. microsoft/agent-governance-toolkit

  • 作者: microsoft
  • 语言: Python
  • ⭐ 星标: 5,182(今日 +46) | 🍴 Fork: 833
  • 许可证:MIT
  • 标签: agent-framework, ai-agents, ai-safety, compliance, governance, microsoft, owasp, policy-engine, python, security, trust, zero-trust

项目定位: 微软开源的 AI Agent 治理工具包,提供策略执行、零信任身份、执行沙箱与可靠性工程,覆盖 OWASP Agentic Top 10 全项合规。

核心特性:
– 策略引擎支持 YAML/OPA/Cedar,调用前拦截实现确定性拒绝,结构层面杜绝越权操作
– 零信任身份体系(SPIFFE/DID/mTLS),多 Agent 共享凭证场景下实现精准审计溯源
– 四级特权环执行沙箱,按风险等级隔离工具调用,最小权限原则落地
– SRE 级运维能力:熔断开关、SLO 监控、混沌测试,保障生产环境稳定性
– MCP 安全网关检测工具投毒/漂移/拼写劫持/隐藏指令,兼容 Model Context Protocol
– 合规 CLI 工具链:OWASP 验证、策略检测、红队扫描、提示注入 12 向量审计

适用场景:
– 自主 AI Agent 生产部署的全生命周期治理
– 多 Agent 协作系统的身份隔离与审计追踪
– 满足 OWASP Agentic Top 10 合规要求的场景
– MCP 服务端工具安全防护与供应链治理

技术亮点:
– Rust 核心策略运行时(Agent Control Specification),无状态、确定性、拒绝优先
– 多语言 SDK:Python/TypeScript/.NET/Rust/Go,统一治理接口
– SPIFFE/DID/mTLS 身份 + OPA/Cedar 策略 + 篡改证据审计日志三层架构

快速上手:
pip install agent-governance-toolkit[full] 安装完整包含治理模块的分发版
– 两行代码接入:from agentmesh.governance import govern; safe_tool = govern(my_tool, policy="policy.yaml")
– CLI 验证合规:agt doctoragt verify --strictagt red-team scan ./prompts/ --min-grade B

注意事项:
– 处于 Public Preview 阶段,GA 前可能有破坏性变更
– 旧版 agent_os 导入会触发 DeprecationWarning,需迁移至 agent-governance-toolkit-core


11. yorukot/superfile

  • 作者: yorukot
  • 语言: Go
  • ⭐ 星标: 21,463(今日 +662) | 🍴 Fork: 695
  • 许可证:MIT | 主页:https://superfile.dev
  • 标签: bubbletea, cli, file-manager, filemanager, filesystem, golang, hacktoberfest, linux-app, terminal-app, terminal-based, tui

项目定位: superfile 是一款美观现代的终端文件管理器,支持跨平台、插件扩展、主题定制与 Vim 风格热键,提供开箱即用的华丽交互体验。

核心特性:
– 跨平台支持 Linux/macOS/Windows(Windows 尚未完全支持)
– 插件系统可扩展功能,主题系统支持深度外观定制
– 内置自动更新检查(每 24 小时一次),可通过配置关闭
– 提供 Vim/Neovim 风格热键配置,适配编辑器用户肌肉记忆
– 多种安装方式:一键脚本、Homebrew、Winget、Scoop、源码构建
– 基于 Go 编写,单二进制文件,无外部依赖,启动迅速

适用场景:
– 终端重度用户寻求美观高效的文件管理
– 跨平台开发者需要统一的终端文件操作体验
– Vim/Neovim 用户希望沿用熟悉的键位操作文件
– 喜欢折腾配置、主题与插件的极客用户

技术亮点:
– Go 语言编写,单二进制分发,零运行时依赖
– 插件架构与主题系统支持运行时动态加载
– 自动更新机制基于 GitHub Releases API 实现

快速上手:
– macOS/Linux 一键安装:bash -c "$(curl -sLo- https://superfile.dev/install.sh)"
- Windows 安装:
winget install –id yorukot.superfilescoop install superfile- 启动命令:spf`

注意事项:
– Windows 支持尚不完整,部分功能可能受限
– 自动更新检查频率固定为 24 小时,仅可开关不可自定义间隔


12. bradautomates/claude-video

  • 作者: bradautomates
  • 语言: Python
  • ⭐ 星标: 12,074(今日 +988) | 🍴 Fork: 1,213
  • 许可证:MIT

项目定位: 为 Claude 等 AI 代理赋予“看视频”能力:自动下载、抽帧、转录字幕(或回退 Whisper),将画面与时间轴文本一并送入上下文,让模型像人类一样真正看懂视频内容。

核心特性:
– 支持 yt-dlp 兼容的所有在线视频平台及本地文件,零配置首次运行自动安装 ffmpeg/yt-dlp
– 四档细节模式:transcript 纯文本、efficient 关键帧极速、balanced 场景变化均衡、token-burner 无上限全帧
– 智能去重:以 16×16 灰度图均值亮度差阈值 2.0 剔除近似帧,节省 Token 且保留细微变化
– 原生字幕优先、无字幕自动回退 Whisper(Groq/OpenAI),仅在必要时消耗 API 成本
– 支持 –start/–end 时间戳聚焦片段,单位秒或 MM:SS,显著提升长视频分析密度与性价比
– 跨宿主分发:Claude Code、Codex、Cursor、Copilot、Gemini CLI、claude.ai Web 及 50+ Agent Skills 平台一键安装

适用场景:
– 拆解爆款视频开头钩子、结构与广告创意
– 通过屏幕录像定位 Bug 触发帧并推断根因
– 将长视频/播客/课程快速转为可检索笔记
– 去除发布会视频中的营销废话,提取实质更新

技术亮点:
– yt-dlp 下载与字幕提取 + ffmpeg 抽帧/转音频,Python 实现基于均值绝对差的帧去重
– Whisper 回退支持 Groq whisper-large-v3 与 OpenAI whisper-1,音频统一转 16kHz 64kbps mono MP3
– 基于 Agent Skills 规范打包,SKILL.md 自解析脚本路径,实现多宿主免改动分发

快速上手:
– Claude Code: /plugin marketplace add bradautomates/claude-video 然后 /plugin install watch@claude-video
– Codex/Cursor/Copilot/Gemini 等: npx skills add bradautomates/claude-video -g 全局安装
– claude.ai Web: 下载最新 release 的 watch.skill,在 Settings→Capabilities→Skills 中拖入

注意事项:
– 图像 Token 成本随帧数线性增长,长视频默认上限 100 帧并提示稀疏扫描,需聚焦片段或用 token-burner 突破
– 无字幕视频必须配置 Whisper API Key(GROQ_API_KEY 或 OPENAI_API_KEY),否则仅能依赖帧分析
– claude.ai Web 要求先开启“Code execution and file creation”权限,否则无法调用 ffmpeg/yt-dlp