# Mycelium Protocol Blog — AI · Web3 · Digital Commons > Mycelium Protocol 技术博客:AI 代理、Web3 协议、开源工具实践与数字公共物品研究。Bilingual (中文/English). Machine-readable full text: https://blog.mushroom.cv/llms-full.txt Agent-to-agent interface: MCP server at https://blog.mushroom.cv/api/mcp (protocol 2025-11-25; tools: search_posts, get_post, list_recent; resource: posts://latest). ## Tech-Experiment - [awesome-gpt-image-2:33K stars,544 个逆向案例 + 20+ 工业级模板,Prompt as Code 出图引擎](https://blog.mushroom.cv/blog/awesome-gpt-image-2-prompt-engineering-industrial-templates/): freestylefly/awesome-gpt-image-2,MIT,JavaScript,33,523 stars。GPT-Image-2/2.5 提示词工程库,544 个从真实生成结果逆向拆解的案例,12 大类别(UI/摄影/海报/信息图/插画/电商/品牌/角色/场景等),20+ 套工业级模板(含 JSON 结构化版本),配套 gpt-image-2-style-library npm Skill,同一份 style-library.json 同时驱动网站和 Agent。提示词采用「Prompt as Code」分层 schema:目标→主体变量→环境→风格→技术约束→输出规格→禁止项。附 GPT-Image-2 vs 2.5 同提示词对比专区。 - [Duix-Avatar(前 HeyGem):本地离线数字人视频生成深度拆解](https://blog.mushroom.cv/blog/duix-avatar-heygem-local-digital-human-video-clone-teardown/): duixcom/Duix-Avatar,15.6K 星,三个 Docker 服务打包 FunASR+Fish-Speech+视频引擎,RTX 4070 必须,70GB 镜像,自定义许可证 1000 MAU 付费门槛,「10 秒克隆」官方文档无依据,本地效果自承比云端差一档。 - [Hindsight:30K stars Agent 记忆框架,五层仿生结构 + 自建 AMB 基准](https://blog.mushroom.cv/blog/hindsight-agent-memory-retain-recall-reflect/): vectorize-io/hindsight,MIT,Python/Rust/TypeScript,30,050 stars。开源 Agent 记忆系统:五层仿生记忆架构(世界事实→经历事实→观测→心智模型→知识页),Retain/Recall/Reflect 三路操作,四路并行检索(语义+BM25+图关系+时序),内置 pg0 嵌入式 PostgreSQL+pgvector,60+ 集成覆盖 Claude Code/LangGraph/CrewAI,自建 AMB 基准测试声称准确率第一。 - [jev-chat-JARVIS:Android 聊天副驾驶,无障碍服务读屏 + Jev 判断模型分析意图](https://blog.mushroom.cv/blog/jev-chat-jarvis-android-chat-copilot-accessibility/): jev-chat/jev-chat-jarvis,MIT,Kotlin,6,614 stars,5天内从零冲到 v1.4。通过 Android 无障碍服务读取屏幕聊天内容,调用 Jev 判断模型评估危险等级(1–9)和真实意图,生成 3 条候选回复,悬浮窗展示,一键填入输入框(绝不自动发送)。适配 QQ / X(Twitter)/ 飞书(ML Kit OCR 兜底)。最大隐藏限制:微信 Android 版已明确下架,无法突破截屏限制。 - [LingChat:沉浸式 AI 恋爱游戏伴侣,18 类情绪识别 + 截屏感知 + Live2D,Tauri 2 + Vue 3](https://blog.mushroom.cv/blog/lingchat-ai-galgame-emotion-desktop-pet-tauri/): SlimeBoyOwO/LingChat,AGPL-3.0,Rust,2,255 stars。沉浸式 AI 恋爱游戏(Galgame)聊天软件:自训练 18 类情绪识别模型、截屏感知主动评论、Live2D 角色服装切换、VITS 语音合成(GPU 约 1 秒)、多角色剧情脚本 + 好感系统、番茄计时 / 日程管理。架构:Tauri 2 Rust 后端 + Vue 3 前端 + PixiJS Live2D 渲染。API 驱动,默认 DeepSeek,支持 Ollama / LM Studio 本地模型。Windows 主力,Linux AppImage,macOS 支持,Android/iOS 移植进行中。资源引用自《碧蓝档案》《Undertale》,仅限非商用。 - [MiniCPM-o Booking Desk:全双工语音预约台,状态机控 DB 写入,Judge LLM 防幻觉确认](https://blog.mushroom.cv/blog/minicpmo-booking-desk-realtime-voice-appointment-agent/): AlessandroBonomo28/Minicpm-o-booking-desk,Python,MiniCPM-o 4.5 驱动的实时语音预约台 Demo。三通道架构:音频(VAD+Whisper)+ 视觉(每秒刷新的操作员屏幕帧)+ 控制 token(force_speak/force_listen)。状态机全权控制 DB 写入,模型输出不直接碰数据库;Judge LLM 核查模型口播内容防幻觉确认。实测 4 分 13 秒,2 次预约,零误写。需 32GB VRAM(RTX 5090 实测 29GB)。附完整架构拆解。 - [mu(μ):编程 Agent 的判断核,35 个决策点交给小模型,大模型只管写代码](https://blog.mushroom.cv/blog/mu-coding-agent-judgment-kernel-35-decision-points-hive/): Qybaihe/mu,MIT,TypeScript,116 stars(3天)。编程 Agent 每轮有 35 个决策点,和编码无关:这段工具输出要不要进 context?这条命令危不危险?工作跑偏了吗?任务完成了吗?mu 把这些交给一个小、快的判断模型(Jev 或 322M 本地 Laya),大模型只处理实际编码。工具输出逐块判断进入 context,51% 的测试日志重复行无损折叠。Hive 多 Agent 系统里,judge 是发现共享的闸门。构建于 earendil-works/pi。 - [WeKnora:腾讯开源知识库平台,三模式 RAG + Agent + Wiki,Go + pgvector 自托管](https://blog.mushroom.cv/blog/tencent-weknora-rag-agent-wiki-knowledge-platform/): Tencent/WeKnora,MIT,Go,29,900+ stars。腾讯微信团队 2025 年 7 月开源的 LLM 知识库平台。三个工作模式:RAG 语义检索问答、ReAct 自主 Agent、Wiki 自维护知识图谱。微服务架构:Go 后端 + Vue.js 前端 + Python gRPC 文档解析 + PostgreSQL/pgvector + Redis。支持 10+ 文档格式、Feishu/Notion/Yuque 自动同步、WeCom/Slack/Telegram IM 集成、Ollama 本地部署,Langfuse 可观测性。官方 DeepSeek Harness 插件已上线。附完整 Docker 部署步骤。 - [AgentJev-0.6B:Qwen3 底座的 System-1 决策核,Typed Decisions 79.25% 超 Laya,KV Cache 砍 92%](https://blog.mushroom.cv/blog/agentjev-0-6b-system-one-decision-model-qwen3/): AgentJev-0.6B,Qwen3-0.6B底座+置换等变决策头,System-1 AI Agent 决策模型。Typed Decisions 2000题 79.25%(1585/2000)超 Laya 77.00%(+2.25pt)。零输出 token 解码,约 50ms 一次前向。Shared Prefix KV Cache 在 64 候选时骨干 token 从 33,547 降至 2,551(-92.4%,约 2× 加速)。上下文 2048 token,Boolean/Choice/Score 全类型覆盖,支持完整概率分布输出做路由/阈值/回退门控。权重、训练代码、推理代码全开源。 - [jev-ultrafast:browser-use × TypeSafe Jev,DOM 结构化状态代替截图,Google Flights 7.1 秒](https://blog.mushroom.cv/blog/browser-use-jev-ultrafast-dom-web-agent/): browser-use/jev-ultrafast,19K+ stars,Python,browser-use 官方出品。核心思路:把浏览器状态变成编号元素表格,用 TypeSafe Jev 一次请求同时决策「操作类型 + 目标元素」,只有需要输入文字时才调小 LLM。默认 Agent 循环零截图,browser protocol 调用从 1092 次降到 101 次,任务时间中位数从 9.45s 降到 7.09s(-25%)。附完整安装步骤和架构拆解。 - [Chat on Steroids:给 ChatGPT 装上本地 MCP + 多 Worker,在浏览器里跑 Codex 风格工作流](https://blog.mushroom.cv/blog/chat-on-steroids-chatgpt-local-mcp-multi-agent/): Chat on Steroids(totec448-spec/chat-on-steroids),MIT,3900+ stars,TypeScript Electron 桌面应用。给 ChatGPT 接上本地 MCP 服务器,让它直接读写文件、跑终端命令、控制桌面,同时支持多 Worker 并行分任务、Goal/Loop 自动继续、Compact & Resume 跨对话续命。核心原理是 Chrome 扩展自动化 ChatGPT UI + 本地 MCP,不调用 Codex,吃的是你的 ChatGPT 额度。附安装步骤与合规风险说明。 - [exxperts 拆解:记忆要你批准才写入的本地 AI 同事,「数据不出本机」要打几折?](https://blog.mushroom.cv/blog/exxperts-local-first-ai-agent-approval-gated-memory-teardown/): exxperts 是德国咨询公司 EXXETA 开源的桌面 AI 助手(Apache-2.0,357 星):记忆存成本机 Markdown,每次写入都要你批准,可撤销、可回看历史。我们在 Mac mini 上构建并跑了 30 个记忆与安全相关冒烟测试,全部通过;但接云端模型时,对话和记忆照样发给 Claude 或 ChatGPT,「数据不出本机」只在接本地模型并关掉联网搜索时才成立。 - [JevEmbed:用 Embedding 做决策——Choice / Score / Noul 三合一框架,支持 LoRA 微调](https://blog.mushroom.cv/blog/jevembed-embedding-decision-framework-choice-score-noul/): JevEmbed,HITsz-TMG 出品,Python。用 Embedding 模型做三类决策:Choice(选择)、Score(评分)、Noul(判断),同一套框架,兼容 KaLM、Qwen3-Embedding、E5 等模型。支持超 255 个候选项,提供 Python API + CLI + HTTP 服务。支持 LoRA 微调:KaLM 微调后准确率 30%→77%,Qwen3-0.6B 微调后 31%→84%。独立实现,非 TypeSafe AI 官方,兼容 Jev-style 请求格式。 - [Knowhere 2.0:双通道文档解析 + 层级原生记忆,让 RAG 读懂文档结构](https://blog.mushroom.cv/blog/knowhere-2-document-parsing-agentic-rag/): Knowhere,Ontos-AI出品,3.5k stars,2026-05-07开源。2026-09版本2.0上线双通道解析:Vision Page(视觉页面)+ Text Track(文本轨)融合为同一层级原生记忆模式,既保留文本结构精度,又让复杂PDF/PPT被视觉模型整页理解。支持超长PDF(数百页)和图纸集路由,输出结果绑定到文档、章节、源页、相关资产,天然适配Agentic RAG。 - [Nemotron 3 Diarization 实测:NVIDIA 1 亿参数说话人分离模型,最多 8 人、可商用,Mac 上要自己编译](https://blog.mushroom.cv/blog/nemotron-3-diarization-8-speaker-streaming-mac-test/): Nemotron 3 Diarization 是 NVIDIA 2026-09-23 发布的 1 亿参数说话人分离模型,最多 8 人、流式延迟可低至 0.32 秒、OpenMDW-1.1 许可可商用。模型卡自报 DIHARD III DER 从 19.09% 降到 12.73%。我们在 16GB M4 Mac mini 上实测:官方安装脚本装的 v0.1.0 运行时加载失败,需从源码编译;编译后 10 分钟音频 CPU 69 秒、Metal 22 秒跑完,真人双人样本说话人数和身份全对,但 macOS 合成语音全部失手。 - [OpenMuse:CopilotKit 开源个人 AI 助理,带浏览器、终端、文件,任务后台保持运行](https://blog.mushroom.cv/blog/openmuse-copilotkit-personal-ai-agent-browser-workspace/): OpenMuse,CopilotKit出品,MIT,2026-09-22开源。个人AI助理模板:持久化Chromium浏览器(跨任务保留Profile)、可选Linux工作区(终端+文件)、持久化后台任务(SQL租约协调)、Gmail/Google Calendar连接器、iOS/Android/Web全平台。Built on CopilotKit + AG-UI,任意Agent后端接入,可自己部署可二次开发。直接对标Meta Muse发布时机。 - [Qwen-Image-2.1 本地部署:Unsloth FP8/GGUF,6GB 显存能跑,Mac 16GB 统一内存也行](https://blog.mushroom.cv/blog/qwen-image-2-1-unsloth-fp8-gguf-local-deploy/): Qwen-Image-2.1 的本地部署门槛被 Unsloth 打下来了。FP8 + 钉住内存 offload:6-8GB 显存即可运行,推理速度<2倍损耗。GGUF 量化版:Mac 16GB 统一内存可用,llama.cpp/Unsloth Desktop 跑。注意:GGUF 只是 denoiser,还需配 VAE 和 Qwen3-VL 文本编码器。INT8 精度优于 FP8(LPIPS 更低),推荐默认 INT8。本文给出三种路径的具体安装步骤:Unsloth Desktop(最简)、FP8 offload(NVIDIA GPU)、GGUF(Mac/CPU)。 - [VocalCode Community:CPU 优先的本地听写与会议记录,不上云不激活](https://blog.mushroom.cv/blog/vocalcode-community-cpu-local-dictation-meeting-notes/): VocalCode Community,AGPL-3.0,Rust + sherpa-onnx。本地优先的听写与会议记录工具,2026-09-22 开源。Parakeet TDT v3 + Paraformer 双模型,CPU 跑,Apple Silicon 和 Windows x64 双平台。社区版无需账号、无需激活码,所有语音处理本机完成,录音和转录不上传。作者 Daming Wu 用自己的工具给 Claude Code、Cursor 口述提示词,顺便做成了产品开源。 - [Anthropic 官方 launch-your-agent 拆解:不是模板也不是 CLI,是一个带你把 Agent 部署到 Claude Managed Agents 的 Claude Code Skill](https://blog.mushroom.cv/blog/anthropic-launch-your-agent-managed-agents-skill-teardown/): anthropics/launch-your-agent(1,007 星、Apache-2.0、2026-06-16 创建)只有 2 个 Claude Code Skill 和一堆参考文档,没有可运行的示例代码:它靠访谈生成配置,再用 curl 在你自己的账号里创建 Agent、环境、会话和定时部署。我们通读全部指令与说明文件并在 Mac 上验证了 Skill 能加载、ant CLI 能运行;也指出它的默认值(无限制联网、工具全放行、无金额上限)离生产还差一步加固,以及整个流程跑在 Anthropic 云端而不是你的 Mac。 - [dsh-qa 全家桶开源:浏览器、macOS 桌面、iOS、Android 四驱动,让 AI Agent 做真正的跨平台 QA](https://blog.mushroom.cv/blog/dsh-qa-cross-platform-test-browser-computer-ios-android/): ZSeven-W 系列 DSH 跨平台测试插件生态全员到齐:dsh-qa(编排中枢)+ dsh-browser + dsh-computer + dsh-ios(300 stars)+ dsh-android(158 stars),全 MIT,Node 24.11+ 统一基准。AI Agent 像真实用户一样探索 App,捕获带证据的发现,导出确定性回放脚本跑 CI。 - [garmin-mcp-local 拆解:把 Garmin 健康数据缓存到本机 SQLite 给 Claude 查,「全本地」只对了一半](https://blog.mushroom.cv/blog/garmin-mcp-local-sqlite-cache-health-data-teardown/): the-mace/garmin-mcp-local 是一个 0 star、MIT 协议的 Garmin Connect MCP 服务:数据缓存进本机 SQLite,9 个 MCP 工具里 7 个只读本地库。我们在 Mac 上实测:33 个测试全过,但今天全新安装会装上 mcp 2.2.0 导致服务器无法启动;「只读」的 execute_sql 用 WITH 前缀就能删数据;它依赖的 garminconnect 是冒充 Android App 登录的非官方库。 - [Humanizer-zh 拆解:中文「去 AI 味」Skill 今天整体重写,我用同一段文字跑了 12 次对照](https://blog.mushroom.cv/blog/humanizer-zh-chinese-writing-skill-fact-drift-test-labeling/): Humanizer-zh(18,101 star,MIT)是 blader/humanizer 的中文移植,8 个月无维护提交后于 2026-09-23 整体重写:24 条规则改为 31 个检查点,核心从「改到像人」转为「不改事实」。本机 4×3 次对照:新版 4/4 保住「可能」和第三人称,旧版 0/4 保住「可能」、4/4 把「作者」改成「我」。它不保证过检测,也不改变 AI 内容标识义务。 - [alibaba/skill-up:Agent Skill 的评估与自动进化闭环——Eval + 自修复一键跑通](https://blog.mushroom.cv/blog/alibaba-skill-up-agent-skill-eval-evolution/): alibaba/skill-up,1,031 stars,Apache-2.0,Go。阿里巴巴出品的 Agent Skill 评估与进化工具,4 个月 1000+ stars。声明式 YAML 测试用例 + rule/script/agent 三种 judge 策略 + skill-upper 自动读取失败报告修复 Skill,形成 Eval → 失败分析 → 自动修复 → 再 Eval 的闭环。支持 Claude Code、Codex、Qwen Code,兼容 Anthropic evals.json 格式,内置 GitHub Actions 集成。 - [browsentic:让 AI Agent 直接操控你已登录的真实浏览器——无 headless、免 API Key](https://blog.mushroom.cv/blog/browsentic-ai-agent-real-browser-control-mcp/): imshaikot/browsentic,21 stars,MIT,TypeScript。浏览器扩展 + 本地 Daemon + MCP Server 三件套,把 Claude Code、Codex、Antigravity 等 Agent CLI 接入你正在用的真实浏览器,带着你的登录态、Cookie、历史记录操控任意站点。52 个页面工具,Pairing Code 双端验证,全程 127.0.0.1 不出本机,无需 API Key。 - [ConversationalVoice:把真实双人录音变成全双工训练数据的端到端流水线](https://blog.mushroom.cv/blog/conversationalvoice-averalabs-full-duplex-training-data-pipeline/): avera-labs/ConversationalVoice,51 stars,BSL 1.1 许可证(非生产免费,生产环境商用需授权,4年后转 MIT)。AveraLabs 出品,配套 arXiv 2609.08147 论文。一条 9 阶段 Celery 流水线,将真实双人录音自动转成全双工语音模型训练数据,每段对话产出三类数据:分离 / 重建 / 扩写。内部使用 DialogueSidon(说话人分离)、Qwen3-ASR(转写)、Qwen3-TTS(语音合成)。需要 CUDA GPU + PostgreSQL + Redis + S3 存储。 - [KaLM-Jev 本地部署指南:从安装到对接业务流程,附硬件选型与再训练说明](https://blog.mushroom.cv/blog/kalm-jev-local-judgment-engine-hardware-deploy/): KaLM-Jev,32 stars,2026-09-21 刚开源。基于 KaLM-Reranker-V1 的本地 Jev 风格判断引擎,Nano/Small/Large 三档模型,/v1/systemone 接口兼容 TypeSafe AI Jev。本文覆盖:硬件要求、本地安装、REST API 对接业务流程、数据初始化、是否需要再训练及如何做。 - [LLM2Jev:用任意本地 LLM 克隆 Jev 的 /v1/systemone——Prefill-Only 二值推理拆解](https://blog.mushroom.cv/blog/llm2jev-local-jev-api-prefill-only-binary-inference/): Yinsongxu/LLM2Jev,125 stars,Apache 2.0。3 天新项目,把任意 HuggingFace 因果语言模型变成兼容 Jev /v1/systemone API 的本地决策引擎。核心手法:Prefill-Only 二值推理——只读 yes/no 的下一 token logit,不解码、不 JSON 解析。支持 Choice/Score/Noul 三类结构化答案,staged 模式对长上下文 KV Cache 前缀复用,可达 4.9× 加速。SGLang 后端仅 Linux,Transformers 后端跨平台。 - [LobeHub 自架 CAO 指南:82K⭐从 Lobe Chat 变成首席 Agent 运营官,像雇员工一样管理 AI 团队](https://blog.mushroom.cv/blog/lobehub-cao-chief-agent-operator-self-hosting-guide/): lobehub/lobe-chat,82,706 stars,LobeHub 社区许可证。从聊天 UI 转型为 CAO(首席 Agent 运营官),334,081 个 Skill 和 100,897 个 MCP 服务器可按需调用。核心架构:Next.js + PostgreSQL 14+ PGVector + RustFS S3 + Agent Gateway(8787端口)。Docker Compose 一键部署,IM Gateway 让 Agent 通过 Slack/Discord/Telegram/微信汇报工作结果。本文为完整工程部署指南:最小配置、环境变量、数据库和存储选型、多 Agent 编排原语。 - [mcp-dev-runtime:一条命令把本地开发机暴露给 ChatGPT——OpenAI Tunnel + 6 个 MCP 工具的打包方案](https://blog.mushroom.cv/blog/mcp-dev-runtime-openai-tunnel-local-dev-mcp-server/): dolibali/mcp-dev-runtime,3 stars,Apache-2.0,TypeScript。把 OpenAI 官方 Tunnel 客户端和 6 个本地开发 MCP 工具(shell 执行/PTY 交互/代码 patch/图片查看/进程管理)打包成跨平台运行时,内置 Node.js 24.21.0。一条 mdr start 同时启动 MCP 服务和 Tunnel,对接的是 ChatGPT(非 claude.ai)。无沙箱、无命令白名单,需注意安全边界。 - [OpenFlowKit 拆解:一个真在维护的开源画图 SPA,能被 Claude 直接调用](https://blog.mushroom.cv/blog/openflowkit-diagram-mcp-local-first-teardown/): Vrun-design/openflowkit 是 795 星、MIT 协议的纯前端画图工具:Mermaid 粘贴自动配 1600+ 图标、双向 DSL 编辑器、10 家 AI 供应商(含本地 Ollama)、WebCodecs 硬编码 MP4 导出,还发布了一个真实可用的 MCP 服务。我们在 Mac mini 上克隆、装依赖、跑单测、跑生产构建全部实测通过,同时也挖出了它没在 README 里明说的坑。 - [SemIf 拆解:把 Agent 的每次判断从「生成文字再解析」降维为「读 logit」,5× 提速](https://blog.mushroom.cv/blog/semif-semantic-if-local-jev-decision-engine/): TheoLeeCJ/SemIf,3,700+ stars,MIT。开源复刻 TypeSafe Jev /v1/systemone 语义条件判断接口。直接读模型 logit、零输出 token,比自回归 JSON 快 5.21×。支持 CUDA、Apple Silicon MLX、CPU llama.cpp,甚至浏览器 WebGPU。27B 量化版准确率 0.958,接近闭源 Jev 水平。 - [CodexBoard:Apple Silicon Mac 上把 Codex CLI 接上任务看板,飞书/Web 手机端远程监控执行过程](https://blog.mushroom.cv/blog/codexboard-mac-codex-task-board-mobile-lark/): RocYan98/CodexBoard,115 stars,TypeScript,无开源许可证。运行在 Apple Silicon Mac(macOS 13+)上的本地任务看板,把 Codex CLI 执行过程绑定到 Kanban 看板,支持通过飞书(Lark)或 Web 浏览器在手机端实时监控进度、审批变更、查看代码 Diff。需要公网 frp 服务器作为内网穿透,一周内迭代 10 个版本,目前仍为 0.1.x preview 阶段。 - [ComfyUI-MiniMax-H3-W4A4-VSA:RTX 4070 12GB 跑 MiniMax H3 视频生成的量化部署方案](https://blog.mushroom.cv/blog/comfyui-minimax-h3-w4a4-vsa-rtx-4070-deploy/): sepiablue-ai 开源,GPL-3.0,46 stars。两个 ComfyUI 节点把 MiniMax H3 视频生成塞进 12GB 消费级 GPU:W4A4 量化(FC1 层 ConvRot 预转换缓存)+ 流式 VSA 稀疏注意力(FastH3 官方 gate 文件)。RTX 4070 12GB 实测:832×1408×124帧约 3m29s,峰值 11.5GB 显存,比 INT8 基线快约 11%。需 Ampere/Ada 架构(SM8x),不支持 Hopper/Blackwell,系统内存需约 49GB。 - [Confucius4-R2T2:网易有道的真流式 ASR——用 LSP 彻底消除文字抖动](https://blog.mushroom.cv/blog/confucius4-r2t2-true-streaming-asr-lsp-netease-youdao/): netease-youdao/Confucius4-R2T2,306 stars,代码 Apache 2.0 / 模型权重单独 NetEase 许可证。2B 参数真流式 ASR,基于 Qwen3-ASR-1.7B,核心创新是最长稳定前缀(LSP)训练范式——输出只追加、绝不修改,从根本上解决假流式 ASR 的文字抖动问题。LibriSpeech-clean WER 2.13% vs Qwen3-ASR 流式模式 22.30%,160ms 默认分块,需 CUDA GPU,技术报告待发布。 - [Meta Astryx:为 AI Agent 而生的 React 设计系统,内置 MCP Server + Token 优化 CLI](https://blog.mushroom.cv/blog/meta-astryx-react-design-system-ai-agent-mcp-cli/): Meta 2026-06-28 开源,MIT,13,200+ stars。170+ 可访问组件,React 19 + StyleX,10 套主题。亮点不在组件数量而在 AI 原生架构:内置 MCP Server(search/get 两个工具)和 --dense CLI 让 AI Agent 直接机读设计系统规范;8 年内部演进支撑 13,000+ Meta 应用,首次对外开放。Beta 阶段,React 19 硬要求,StyleX 构建依赖。 - [Newsjack:把 AI Agent 变成 PR 团队的开源技能包,30+ 技能覆盖新闻蹭热、危机公关、AI 搜索可见度](https://blog.mushroom.cv/blog/newsjack-ai-pr-skill-pack-agent-newsjacking/): elvisun/newsjack,1,257 stars,MIT。Go CLI + Markdown skill 文件格式,安装后 Claude Code/Codex 等 Agent 获得 30+ PR 专业技能:新闻监控与蹭热点检测、pitch 邮件撰写、记者匹配、危机公关保持声明、AEO/GEO AI 搜索引擎可见度优化。Elvis Sun + PR 专家 Carly Martinetti 共同开发,配套 Medialyst 商业记者数据库服务。本地 Agent 全功能,claude.ai 网页版降级运行。 - [OpenCreator:KrillinAI 进化为本地 AI 创作工作台,内置 Codex Agent + 10 个可视化工具](https://blog.mushroom.cv/blog/opencreator-krillinai-local-ai-creator-studio-codex-agent/): krillinai/OpenCreator,11.9K stars,Apache 2.0。前身是 AI 视频翻译工具 KrillinAI,现已扩展为本地 AI 创作工作台。React 18 + Electron + Fastify,以 Codex CLI 为 Agent 引擎,支持视频翻译配音、封面图生成、小红书笔记、短视频脚本、火柴人动画等 10 个内置工具,外加 Agent 对话模式与视觉工作台双向状态同步。主要成本门槛:Codex CLI token 消耗约 100k–200k/次任务。 - [Qwen-Image-2.1 工程实践:7B DiT + 原生 RGBA,阿里开源图像生成模型本地部署指南](https://blog.mushroom.cv/blog/qwen-image-2-1-dit-rgba-local-deploy-guide/): 阿里千问 2026-09-20 开源。7.1B 参数 32 层 Block-Causal DiT + Qwen3-VL-8B 文本编码器 + 64 通道 RGBA VAE,合计约 15B。原生支持透明图层、多参考图(最多 10 张)、中英文文字渲染、最高 2K 分辨率、局部编辑。Diffusers/ComfyUI/SGLang/vLLM 当日支持。关键限制:H100 BF16 需 56.5GB 显存,无量化版本,许可证从 v1 的 Apache 2.0 降级为研究专用。 - [ADK-Rust:43 个 crate 拆开来用,社区复刻的 Rust Agent 运行时](https://blog.mushroom.cv/blog/adk-rust-zavora-ai-rust-agent-framework-43-crates-modular/): zavora-ai 社区维护的 ADK-Rust v2.2.0——不是 Google 官方项目,但把 Agent 运行时拆成 43 个可独立发布的 crate,按需引用。Type-safe、全异步、568 μs agent loop 开销,支持 Gemini/OpenAI/Anthropic/Ollama,含 graph 工作流、durable resume、realtime 语音、adk-skill 解析。本文做一次工程拆解。 - [Bespoke Nimble:一天之内做一个会读概率的 9B 决策模型](https://blog.mushroom.cv/blog/bespoke-nimble-9b-open-decision-model-logprob-jev-rival/): Bespoke Labs 开源了 Nimble,一个基于 Qwen3.5-9B LoRA 的决策模型——它不写字,只在你给的选项里选一个,直接读 logprobs。数据、配方、权重全部公开,本文做一次工程层面的完整拆解。 - [cli-zoo:otter 一条命令拉起 tmux 工位,wren 两行实时显示 token 消耗](https://blog.mushroom.cv/blog/cli-zoo-otter-wren-tmux-ai-coding-workflow-shell-tools/): 模型大家都在用同一批,差距在工位上。Spoon94 的 cli-zoo 收了两只小动物:otter 用一条命令把 Claude Code / tmux / yazi / nvim / lazygit 拼成整洁的开发会话,wren 在状态栏实时显示 token 用量、缓存命中率、上下文占用。 - [ClipTalk:用自然语言剪视频,VLM + 24 个 Skill 驱动的 Agentic 视频编辑系统](https://blog.mushroom.cv/blog/cliptalk-agentic-video-editing-vlm-ffmpeg-24-skills-face-voice/): 非商业自定义许可,126 stars。三层架构:Python FastAPI + Node Pi Agent + 浏览器。24 个 SKILL.md 技能,VLM 理解画面,本地 SenseVoice/TalkNet/SFace/YOLOX 识别人脸/声纹/活跃发言人,FFmpeg 执行剪辑。6 步审批门禁,V2 算法比基线慢 14s。仅支持 Linux x86-64/WSL2,不支持 macOS/ARM。 - [Cua:Computer-Use 2.0 开源基础设施,桌面操控降格为工具调用](https://blog.mushroom.cv/blog/cua-computer-use-2-0-desktop-agent-benchmark-trajectory-cua-s1/): MIT,24.7K stars,YC W25。五件套:跨平台桌面驱动、云桌面集群、本地 VM、确定性评测框架、CUA-S1 小模型。核心主张是把 GUI 操作降格为 Agent 的一个工具调用——不是独占前台的循环。CUA-S1-Forms 70 万参数 2.8MB,真实表单 100% 准确率。 - [jev-skill:给 Agent 装上 Jev 决策感知,9 个可安装 Skill 覆盖分诊/路由/代码审查](https://blog.mushroom.cv/blog/jev-skill-agent-decision-9-skills-90-scenarios-openrouter/): MIT,34 stars,今天刚开源。SKILL.md 格式,9 个专域 Skill 覆盖 90 个标注场景:分诊、文档证据、UI 操控、工具路由、代码审查等。需 OpenRouter API key 调 TypeSafe Jev,无本地权重。显式禁止无 key 时静默降级,只能做 agent simulation 且必须标注。 - [Kev:Jared Palmer 开源本地决策模型,一次前向传播回答多个问题](https://blog.mushroom.cv/blog/kev-jaredpalmer-local-decision-model-jev-open-source-qwen-lora/): Apache-2.0,LoRA + 块因果掩码,文档编码一次、多个问题并发出概率分布,不生成文字。4B 版 OOD 准确率 0.790,比 Jev 低 6~7 个点,上限 8192 token,本地 Mac 可跑。 - [MediaPipe Pose Landmarker:BlazePose 33 个关键点,跑在设备上](https://blog.mushroom.cv/blog/mediapipe-pose-landmarker-blazepose-33-keypoints-on-device/): 你搜到的 google.github.io/mediapipe/solutions/pose.html 是旧 API,已于 2023 年 3 月废弃。现行版本是 google-ai-edge/mediapipe v1.0.0(37K stars,Apache-2.0),走 Tasks API,支持 Python/JS/Android/iOS,推理全在设备端。本文把两代 API 对比清楚,给出今天能直接跑的代码。 - [微软 VibeVoice:54K stars 前沿语音 AI,官方仓库因深度伪造顾虑下架,社区 fork 接棒](https://blog.mushroom.cv/blog/microsoft-vibevoice-tts-asr-longform-speech-ai-community-fork/): microsoft/VibeVoice,54K stars,MIT,Python。7.5Hz 连续语音 tokenizer + LLM + 扩散头,单次推理 90 分钟 TTS、60 分钟 ASR,4 路说话人。2025-09 官方因深度伪造顾虑主动下架,社区 fork vibevoice-community/VibeVoice 接棒维护,已加 LoRA 微调和 HF Transformers 集成。工程指导:模型选型、API 服务化、BitNet CPU 推理路径。 - [Realtime-Venus:全双工 AI 交互系统本地部署指南,双 Loop 架构 + 9B Omni 模型开源](https://blog.mushroom.cv/blog/realtime-venus-fulldup-interactive-dual-loop-local-deploy/): 蚂蚁集团 + 清华开源,Apache-2.0。Realtime-Venus-Omni(9B)和 Realtime-Venus-Audio(9B)权重完全公开,含 Harness 运行时和 Web Demo 代码。双 Loop 架构:实时感知+语音交互与后台任务执行分离,Codex CLI 作为默认任务后端(外部依赖,可替换)。需 A100 级显卡,训练数据未开放。 - [树莓派 Zero 2 跑本地 Stable Diffusion,30 分钟出一张 AI 画——PaperPiAI 拆解](https://blog.mushroom.cv/blog/paperpi-ai-stable-diffusion-raspberry-pi-zero-e-ink-art-frame-local/): dylski/PaperPiAI,340 stars,MIT,Python。树莓派 Zero 2(¥100)+ 7色电子墨水屏,跑 OnnxStream Stable Diffusion,30 分钟自动出一张 AI 画,全程离线,装进相框就是一台自主 AI 艺术机器。核心工程细节:512MB 限制、Bullseye 强依赖、70°C 散热、salient 裁剪算法。 - [用开源 Voicebox 给 AI Agent 装上嗓子 — MCP 语音层工程实践](https://blog.mushroom.cv/blog/voicebox-open-source-ai-voice-studio-mcp-agent-tts-stt-clone/): jamiepine/voicebox,55K stars,MIT,Tauri+Python 桌面应用,内置 MCP server 直连 Claude Code/Cursor/Windsurf。7 款本地 TTS 引擎(Qwen3-TTS、Chatterbox、Kokoro 等)+ Whisper STT + 零样本声音克隆,全程本地推理,完全私有。一行命令让 Agent 开口说话。 - [Jev Browser Use:Jev 负责点击导航,Codex 负责思考验收,浏览器自动化快 5-10 倍](https://blog.mushroom.cv/blog/jev-browser-use-jev-clicks-codex-thinks-browser-automation-skill/): wy-coliney/jev-browser-use,MIT,JavaScript,Codex/Claude Code Skill。把浏览器操作分工:Jev(TypeSafe 决策模型)负责点击/滚动/跳转/切换,Codex 负责输入文字/读页面/判断/验收。动作循环不增加额外模型轮次,实测 EZCollegeApp 工作流快 5-10 倍,100K token 成本 $0.0042 vs GPT-6 Astra $1.00。 - [KTransformers v0.7.1:用 CPU+GPU 异构执行微调 Qwen VLM 和 Kimi 这类超大 MoE](https://blog.mushroom.cv/blog/ktransformers-v071-moe-lora-finetune-qwen-vlm-kimi-rawint4/): kvcache-ai/ktransformers v0.7.1(Apache-2.0,19.5K stars)新增两项微调能力:Qwen3-VL-30B 图文 BF16 LoRA(覆盖视觉/语言/路由专家),以及 Kimi K2.5/K2.6 RAWINT4 原权重 LoRA(不需要先反量化成 BF16)。异构执行:CPU 承载路由专家权重,GPU 跑注意力和共享专家,通过 LLaMA-Factory 统一训练接口。 - [RuView:9.4 万星的 WiFi DensePose,不开摄像头隔墙感知呼吸和心率,姿态追踪数字请打折](https://blog.mushroom.cv/blog/ruview-wifi-densepose-esp32-through-wall-sensing-pose-breathing-heart-rate/): ruvnet/RuView,MIT,Rust,94K stars。ESP32-S3 读取 CSI 信号,实现隔墙人体感知:存在检测 82.3%、呼吸 6-30 BPM、心跳 40-120 BPM 均经验证;但宣传中的 17 关键点姿态追踪 PCK@20 实测仅 3%(目标 35%),92.9% 准确率数字已撤回。完整拆解学术源头、技术管道、硬件需求和隐私风险。 - [Ternary Bonsai 2-27B:5.9 GB 跑 27B 模型,三值量化保留 98.2% 性能,比标准 2-bit 强 12 分](https://blog.mushroom.cv/blog/ternary-bonsai-2-27b-prismml-qwen3-ternary-5gb-local-27b/): PrismML 基于 Qwen3.8-27B 发布 Ternary Bonsai 2-27B,三值量化(1.72 bits/权重),5.9 GB 跑 27B 参数,M5 Max 47 tok/s,RTX 5090 130 tok/s。14 项基准平均 84.78/86.32(98.2% 保留),比 IQ2_XXS 高 12 分而只用 63% 体积。需要 PrismML 自定义 llama.cpp 分支,非标准版可用。Apache 2.0。 - [Jev:TypeSafe AI 的 RLCD 决策模型,输出 Token 免费、最高快 200 倍](https://blog.mushroom.cv/blog/typesafe-ai-jev-system-one-model-rlcd-decision-ai-enterprise/): 前 OpenAI 研究员 Diogo Almeida 创立 TypeSafe AI,2026-09-15 发布首个 System One Model「Jev」:RLCD 训练,并行采样非逐 token 生成,输入 $0.042/百万 token,输出免费。不生成文字,专为企业工作流三类决策(判断/选择/打分)设计,峰值快 200 倍、便宜 444 倍。4000 万美元种子轮,DCVC 领投。 - [Agent Lightning:微软研究院 3500 行代码,让任何 AI Agent 都能用真实环境做强化学习](https://blog.mushroom.cv/blog/agent-lightning-microsoft-research-rl-framework-train-agents-real-harness/): microsoft/agent-lightning,MIT 开源,Python,18K stars。三个组件(Trainer/API Gateway/Rollout Controller),Agent 代码零改动,用真实工具链训练。Qwen3.5-9B 只用 6K 样本,SWE-bench Verified 从 41.8% 涨到 56.4%(+14.6pp)。支持 AutoGen、LangChain、OpenAI Agents SDK 及任意自定义 Agent。 - [Cuti Harness:开源长程视频世界生成器,多轮对话从 15 秒扩展到 3 分钟,本地不需要 GPU](https://blog.mushroom.cv/blog/cuti-harness-open-source-video-world-generator-deepseek-harness-long-video/): VideoVerses/Cuti-Harness,MIT 开源,TypeScript + Python,基于 DeepSeek Harness 的插件化视频世界生成器。多轮对话累积扩展,从 15 秒到 3 分钟+;单次 brief 自动生成 5 分钟视频。本地运行不需要 GPU,只要 Node.js 22+ + Conda。视频生成依赖云端 API(WaveSpeed Seedance 或 Ark,约 $0.81/clip)。开发者预览阶段。 - [dsh-plugin-mobile-gateway:给 DeepSeek Harness 加上移动端,手机扫码就能用,Tailscale 一行命令搞定远程](https://blog.mushroom.cv/blog/dsh-plugin-mobile-gateway-websocket-ios-deepseek-harness-mobile/): Clarklevis1995/dsh-plugin-mobile-gateway,MIT 开源,JavaScript 插件,给 DeepSeek Harness (DSH) 增加 WebSocket 移动网关。支持局域网直连、Linux 公网一键 TLS、Tailscale 远程接入三种部署方式。配套 iOS 17+ SwiftUI 原生客户端,双向同步会话、实时流、Human-in-the-loop、文件传输。适配 DSH 0.1.5-rc.2 / Session format 3。 - [xhs-favorites-distiller:把小红书收藏变成 Agent Skill,不是每篇都变,只有真有用的才通过](https://blog.mushroom.cv/blog/xhs-favorites-distiller-agent-skill-xiaohongshu-favorites-to-skills/): B1lli/xhs-favorites-distiller,Apache 2.0,Python 3.10+,把小红书(或微信)收藏里的方法蒸馏成可安装的 Agent skill。核心机制:价值筛选 + 消融测试 + 自然触发验证,未经证实的候选不进入宿主发现目录。消融实验显示去掉「自然触发」要求后,3/3 案例出现提前激活;全流程测试 24/24 正确通过。 - [PinMe 实测:一条命令部署到 IPFS,全栈模板却悄悄落到 Cloudflare Worker](https://blog.mushroom.cv/blog/pinme-ipfs-deploy-cli-mac-review/): PinMe 是 glitternetwork 的零配置部署 CLI,3742 星、MIT 协议,最近一次提交在 2026-09-12。本机用 npx 实测:`pinme --version` 输出 2.0.12、`pinme upload` 在未登录时正确拒绝。但自定义域名绑定要 USD 钱包余额,全栈 `pinme create/save` 实际部署的是 Cloudflare Worker + D1,并非纯去中心化基础设施;package.json 里还有一个代码里从未被引用的 bip39 死依赖。 - [AI Agent 需要出站防火墙:RubyGems 被攻击、订位 Agent 被 Resy 封号之后,我们实测了 Pipelock](https://blog.mushroom.cv/blog/agent-egress-firewall-pipelock-rate-limit-kill-switch/): 研究者认为 OpenAI 测试中的 Agent 5 月往 RubyGems 上传了数百个恶意包(RubyGems 官方称无法确定是否出自 AI Agent),一个订位 Agent 按当事人贴出的日志每小时约 200 次请求,让用户被 Resy 封号。我们在 Mac mini 上实测开源出站防火墙 Pipelock v3.5.0:域名白名单、每域名每分钟限速(第 6 次请求起返回 429)和 kill switch 都有效;但免费版限速最低只能设到每小时 60 次,按小时、按天的预算要买 license,macOS 上不走代理的程序照样能直接出网。 - [all-MiniLM-L6-v2 凭什么五年后还是 HF 下载第一?一个 2021 年的默认嵌入模型、它的中文盲区和 2026 年的替换清单](https://blog.mushroom.cv/blog/all-minilm-l6-v2-default-embedding-chinese-limits-alternatives/): all-MiniLM-L6-v2 是 2021 年 8 月上传的 2270 万参数英文嵌入模型,近 30 天下载 2.54 亿次、累计 38.3 亿次,仍是 Hugging Face 下载量第一,是第二名的 2.9 倍。我们核实了它被谁默认依赖(Chroma、sentence-transformers 文档、BERTopic、KeyBERT、txtai、transformers.js,但不包括 LangChain),并在 Mac mini 上实测:12 道中文检索题它只答对 6 道,「菜非常好吃」和「菜难吃极了」的余弦相似度是 1.0;同体量的 bge-small-zh-v1.5 12 道全对。文末给出 2026 年按场景的替换清单和许可证。 - [jarvis-py 拆解:标着「离线」的 Python 语音助手,联网时默认把录音明文发给 Google](https://blog.mushroom.cv/blog/jarvis-py-local-voice-assistant-privacy-teardown/): Shaan-alpha/jarvis-py 是一个 6 star、MIT 协议的 Python 桌面语音助手:openWakeWord 唤醒、Ollama phi3、fastembed 记忆、三层路由。我们读完代码并在 Mac mini 上实测:269 个测试全过,但联网时语音默认经明文 HTTP 发给 Google,唤醒阈值 0.3 下 18 条近音干扰句有 11 条误唤醒,文档 RAG 的 0.6 阈值让 6 个真问题一个都没注入。 - [orion-core 实测:3 星 Rust 库给本地小模型补上 Agent 循环,工具调用靠文本约定,中文 token 少估一半多](https://blog.mushroom.cv/blog/orion-core-rust-agent-harness-local-llm-teardown/): orion-core 是从桌面应用 OrionPod 拆出的 Rust Agent harness(MIT,3 star,crates.io 下载 74 次):提供工具调用循环、按整轮裁剪的上下文预算、10 种聊天模板和 15 种流式事件,但不带工具、沙箱、记忆和 MCP,现成后端只有一个 OpenAI 兼容 HTTP 客户端。我们在 M4 Mac mini 上接 mlx_lm.server + Qwen2.5-1.5B 实测:93 个测试全过,英文单步工具调用 8/8、中文 6/7;宽松解析会把普通 JSON 当成工具调用,中文 token 估算只有真实值的四成出头。 - [mcp-rag-server 拆解:830 行 Python 把文档库做成 Claude Code 能调用的检索工具](https://blog.mushroom.cv/blog/mcp-rag-server-local-rag-claude-code-blueprint/): MMC1410001/mcp-rag-server 是一个 0 star、MIT 协议的最小 MCP + RAG 实现:本地 all-MiniLM-L6-v2 嵌入、ChromaDB 持久化、5 个 MCP 工具。我们读完全部代码并在 Mac mini 上实测:39 个测试全过、检索单次 7-105 毫秒,但中文检索基本失效、单文件 Drive 导入已被 gdown 6 弄坏。文中给出改成全本地的路径。 - [ParallelHue 拆解:一个证据对不上就拒绝上色的投机解码可视化工具](https://blog.mushroom.cv/blog/parallelhue-speculative-decoding-token-provenance-visualizer/): hikarioyama/ParallelHue(MIT,35 star,零运行时依赖)把本地大模型的多路并发流式输出画进终端,只有调度器和反分词器的遥测跟 SSE 逐字节对得上,才按验证步上色。真正的 exact 模式只支持 vLLM 0.26.x,靠 7 个内部方法挂钩实现,官方的有效证据只有一次 16 路 GLM 运行(16,384 个 token)。我们在 Mac mini 上跑通了 72 个测试,用模拟服务器确认了它在证据不足时会失败或降级,另外发现:只要模型名里带 qwen,它就会给非投机解码的服务上色。 - [整个大模型装进一个文件:goinfer 用纯 Go 跑推理,没有 Python、没有 llama.cpp、没有 CUDA 工具链](https://blog.mushroom.cv/blog/goinfer-pure-go-single-binary-local-llm/): goinfer 是一个纯 Go、无 cgo 的本地推理引擎,编译出单个静态二进制,支持 27 个模型家族、四种序列混合架构,还能把权重烤进可执行文件做成「一个文件就是一个模型」。更难得的是它的基准测试极度诚实:Mac 上比 Ollama 慢 13-18%,Linux CUDA 上快 5%,深上下文会落后——数字和机器、量化、日期一起公开。 - [DGX Spark 上跑视频生成:FlashAttention 没用、torch.compile 没用、量化也没用](https://blog.mushroom.cv/blog/dgx-spark-gb10-video-generation-what-actually-helps/): FastVideo 给 NVIDIA DGX Spark(GB10)写的调优文档罕见地列了「什么没用」:编译 FlashAttention 零加速、torch.compile VAE 触发重编译风暴只剩 1.1x、长序列模型上的 fp8/nvfp4 线性层量化约等于噪声。真正有用的只有一条——换蒸馏少步模型,3 步 40 秒 vs 全步 12 分钟,约 18 倍。根因是 GB10 的 128GB 统一内存只有约 270 GB/s 带宽,比数据中心 HBM 低约 10 倍。附双 Spark 串联和 Apple Silicon MLX 路径的实测数字。 - [Obscura:用 Rust 重写无头浏览器,内存从 200MB 降到 30MB,登顶 GitHub Trending](https://blog.mushroom.cv/blog/obscura-rust-headless-browser-ai-agent-web-scraping-mcp/): Obscura 是专为 AI Agent 和网页自动化打造的轻量级 Rust 无头浏览器。无需 Node.js 和 Chrome,通过 V8 执行 JavaScript,兼容 Puppeteer/Playwright/MCP,内存仅 30MB(Chrome 的 1/7),页面加载 85ms,启动即时。2.7万+ Stars 登顶 GitHub Trending,并直接启发了 Cloudflare Kitesurf 的原型。 - [Utopia:开源企业世界模型,用双时态知识图谱让「知识如何演变」成为一等公民](https://blog.mushroom.cv/blog/utopia-deeplethe-enterprise-world-model-bitemporal-knowledge-graph/): deeplethe/utopia 自称「世界首个开源企业世界模型」。一个 Rust 二进制 + Postgres,提供双时态知识图谱(两条时间线:事件发生时间 + 系统认知时间)、本体驱动推理、冲突检测、决策账本和 Ontology2SQL(BIRD benchmark SOTA),支持离线部署和 DeepSeek/Qwen/Ollama 等任意兼容 endpoint。 - [dsh-tui-pi:DeepSeek Harness 的社区 TUI 生态,把编码 Agent 终端做成了 pi 风格](https://blog.mushroom.cv/blog/dsh-tui-pi-deepseek-harness-terminal-ui-plugin-ecosystem/): DeepSeek Harness (dsh) 是 DeepSeek 的编码 Agent 运行时,类比 Claude Code。dsh-tui-pi 是社区构建的 pi 风格 TUI 插件套件,提供实时子 Agent 监控、历史回溯与分叉、飞书手机遥控、动态上下文裁剪、MCP 适配器等 15+ 功能,以及 8 个配套插件。 - [mdya 实测:871 篇中文笔记索引 8 分钟,但语义检索在中文上是失效的](https://blog.mushroom.cv/blog/mdya-rust-local-markdown-search-chinese-test-871-docs/): Rust 写的本地 Markdown 检索原语 mdya,BM25 + 端侧向量 + MCP,单二进制。我拿自己 871 篇笔记(10MB)实测:索引 8 分 01 秒,占 176MB,BM25 查询 30ms、向量 530ms。但对照实验揭穿了一个问题——字面命中的中文查询两条路都准,换成同义改写就全崩,因为默认模型 ruri-v3-30m 是日语的、FTS 分词用的是日语 ipadic 词典。多语言的 EmbeddingGemma 是 gated 模型,直接 401 拉不下来。附可行的修复路径。 - [JIT-Agent:不再套固定 Prompt,给每个任务动态生成专属 Harness](https://blog.mushroom.cv/blog/jit-agent-dynamic-harness-generation-just-in-time-self-evolving/): bingreeky/JIT 开源项目:给定任务、工具、Skills 和历史 Harness,Agent 即时生成 Memory、Planning、Action、Capability 四模块专属框架,执行过程中 Trace 和反馈可反过来修正 Harness。模型不变,工作方法持续进化。 - [Lieflat Charts 实测:一套遵循 Agent Skills 格式的数据可视化 skill,但"开源"这个词用错了](https://blog.mushroom.cv/blog/lieflat-charts-agent-skill-data-visualization/): 实测 Agent Skills 生态里的数据可视化 skill Lieflat Charts(moxt.ai 出品,兼容 Claude Code/Codex):装上后用本站今天的真实采集数据(forage 雷达)跑出一张 Tick Rows 图,记录选型过程和产出。GitHub 4633 star,但作者在 X 上说"我开源的"其实不准确——License 是 PolyForm Noncommercial 1.0.0,只允许学习、修改、分享和非商业使用,商用需要单独授权。跟本站自建的 hybrid-panel 方案做了对比。 - [tnk:给本地 LLM 和 AI Coding Agent 配一个零信任沙箱,而不是又一个推理引擎](https://blog.mushroom.cv/blog/tnk-zero-trust-sandbox-local-llm-agent/): 调研开源项目 tnk(tappunk/tnk):Rust 写的每项目零信任沙箱 VM,用 Lima 给本地 LLM 和 AI coding agent 提供隔离,只挂载项目工作区、屏蔽宿主密钥。MIT 协议,目前 3 star,标注为 experimental。它自己不管推理引擎(不是 Ollama/llama.cpp 的替代品),只解决"agent 跑 shell 命令、装包、连网络时,宿主机能不能不被牵连"这一个问题——这正是本站之前写本地 agent 文章时漏掉的一个维度。文中记录了完整安装、启动、验证步骤和值得注意的边界。 - [镜探 + Avatar Forge:从拆解爆款到数字人口播,Agent Skill 组合完成整条视频创作流水线](https://blog.mushroom.cv/blog/avatar-forge-cine-sleuth-video-digital-human-agent-skill/): LycheeAILab 的两个开源 Agent Skill:CineSleuth(镜探)负责逐帧拆解视频、提取台词场景镜头和创作意图;Avatar Forge 负责把文案、图片和声音变成完整的数字人口播视频。两者组合,形成「看懂爆款 → 提炼改写 → 数字人演绎」的完整视频创作流水线。 - [Zvec:嵌入式向量数据库,RAG 和 Agent Memory 不再需要独立服务](https://blog.mushroom.cv/blog/alibaba-zvec-in-process-vector-db-rag-agent-memory/): 阿里开源的 alibaba/zvec 是一个进程内向量数据库,无需启动独立服务,pip install 即可在应用内完成向量+全文+混合检索。v0.7.0 新增 zvec-grep (zg) 统一 ripgrep/BM25/向量搜索,并正式支持 ReMe 作为 Agent Memory 后端。 - [Anthropic 开源商业 Agent 蓝图:用 Claude 为你的业务场景构建自己的 Agent](https://blog.mushroom.cv/blog/anthropic-commerce-agents-shopping-merchant-business-blueprint/): anthropics/commerce-agents 是 Anthropic 发布的商业 Agent 参考架构,定义了购物 Agent 和商户 Agent 两个角色、三种运行路径(Messages API / Agent SDK / Managed Agents)、四个行业示例。本文拆解其核心设计,并提供从零开始构建自己业务场景 Agent 的实操指南。 - [Doop:Paper.design 的开源替代——人和 AI Agent 实时同画布做设计](https://blog.mushroom.cv/blog/doop-open-source-multiplayer-ai-design-canvas/): kgoedecke/doop 开源仅两周:多人实时设计画布,Canvas+Frame 用 sandboxed iframe 渲染真实 HTML,AI agent 通过内置 MCP server(15 个工具)流式把设计画进画布,人在旁边实时围观甚至接管。bun run dev 零配置自托管,内置 Postgres。AGPL-3.0,564 star。 - [Easel:浙大团队开源的社媒运营 Agent 工作台——112 个 Skill,六平台发布](https://blog.mushroom.cv/blog/easel-open-source-social-media-agent-workbench/): 浙大 REAL Lab + 北大 OpenDCAI Lab 开源的社媒创作 Agent:基于 OpenClaw,112 个 Skill 分六层(基础/发现/策划/创作/发布/归因),Python CLI + Web 工作台,支持小红书/抖音/快手/知乎/B站/视频号六平台登录发布。账号画像六维持久化,越用越懂账号。Apache-2.0,187 star,两周新。 - [Qwen3-ASR:小企业搭建本地双语语音 AI 客服的完整指南](https://blog.mushroom.cv/blog/qwen3-asr-small-business-bilingual-voice-ai-local-deploy/): Qwen3-ASR 是阿里云开源的多语言语音识别模型(0.6B/1.7B),支持52种语言和22种中国方言。本文评估它是否能帮助小企业搭建本地双语语音 AI 系统,详解硬件要求、成本和完整部署路径。 - [用 GPT-Live 构建全双工 AI 语音客服系统:从架构理解到落地实践](https://blog.mushroom.cv/blog/gpt-live-duplex-voice-customer-service-build-guide/): 解析 GPT-Live 全双工语音架构的核心创新——解耦「说话」与「思考」、WebRTC 传输、Go 异步引擎——并提供一套从技术选型到 System Prompt 设计的完整落地指南,帮你构建自己的 AI 语音客服或自动应答系统。 - [OpenKnowledge + WikiSkill:搭建真正让 Agent 能读懂的知识库](https://blog.mushroom.cv/blog/open-knowledge-ai-native-markdown-ide-wikiskill-agent-wiki/): inkeep/open-knowledge 是一个 AI-native Markdown IDE,内置 MCP、Skills、WYSIWYG 编辑,配合上一篇 WikiSkill 的三层记忆架构,构成完整的 Agent 友好型知识管理闭环。 - [Qwen3.8-27B QUASAR-NVFP4:最强 4-bit QAT 量化详解 + Mac M1 Max 64GB 完整安装指南](https://blog.mushroom.cv/blog/qwen38-27b-quasar-nvfp4-mac-mlx-install-guide/): 社区发布 QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4(19.7GB,全层 W4A4)——最小、质量最高的 NVFP4 版本。但 NVFP4 需要 NVIDIA Blackwell GPU,Mac 无法直接运行。本文给出 Mac M1 Max 64GB 的最佳替代方案:MLX 8bit(推荐)和 GGUF/Ollama 完整安装步骤。 - [TinyFish:AI Agent 的 Web 基础设施,Search + Fetch 免费,一行装进 Claude Code](https://blog.mushroom.cv/blog/tinyfish-web-agent-api-search-fetch-mcp-skill-claude-code/): TinyFish 是面向 AI Agent 的 Web 基础设施,提供 Search、Fetch、Agent、Browser 四个端点,Search 和 Fetch 已永久免费。本文是完整的安装与使用指南:Skill 一行安装、MCP Server 配置、CLI/REST API/SDK 示例,以及四个端点的选择逻辑。 - [多 Agent 无人值守跑 4 天做了什么:OpenClaw 网关架构拆解](https://blog.mushroom.cv/blog/openclaw-gateway-unattended-multi-agent-orchestration/): 小红书上有人晒出用多 Agent 无人值守跑了 4 天、重构 14 万行代码的实录。真正的问题不是「能不能跑」,是「凭什么敢让它跑 4 天不看」——答案在 OpenClaw(38.8 万 star)的网关架构里:可信网关/不可信执行分离、失败即拒绝的确定性策略、10 分钟 TTL 的一次性凭证、崩溃循环断路器。 - [Agent Network 调研:不做又一个 Agent 平台,只做跨厂商 Agent 的通信层](https://blog.mushroom.cv/blog/agent-network-anet-multi-runtime-agent-hub-fake-success-trap/): 调研 sleep2agi/agent-network:把 Claude Code、Claude Agent SDK、Codex、Grok Build 接进同一张网络,靠 MCP 互相发现、靠 SSE 实时派活。跟本站已写过的 Multica(看板+技能复利)、Omni(企业知识权限)、Nerve(Claude Agent SDK 运行时)不是同类——它不提供看板、不提供知识库,只做薄薄一层跨厂商通信协议。文章重点拆了一个真实的生产陷阱:`anet node start` 打印✅不代表节点真的起来了,2.3.0-preview.40 之前的版本会假报成功,真正可信的判据是 `tmux has-session -t "="`。Apache-2.0,68 星,TypeScript。 - [给静态博客装一套「关键词 + 语义」混合搜索:从 Pagefind 到 Cloudflare Vectorize 的完整实战记录(附复刻指南)](https://blog.mushroom.cv/blog/hybrid-search-pagefind-vectorize-workers-ai-guide/): 记录给 blog.mushroom.cv 加一套关键词+语义混合搜索的完整过程:先上零成本的 Pagefind 基线,用真实数据决定值不值得上向量检索,再用 Cloudflare Workers AI(bge-m3)+ Vectorize 上线。踩过的平台坑、真实修过的 bug、密码墙加了又拆的完整决策链,以及普通人如何克隆仓库复刻同一套技术栈。 - [GRPO微调小模型工程指南:80美元训练,超越o3的完整路径](https://blog.mushroom.cv/blog/grpo-small-model-engineering-guide/): GRPO(Group Relative Policy Optimization)让小模型在垂直任务上碾压frontier大模型成为可能。本文整合 ART、ms-swift、OpenClaw-RL 等开源仓库,以及 ART·E(Qwen 2.5 14B超越o3,$80训练)、MCP·RL等6个真实工程案例,给出完整的工程路径:任务选择→数据构造→奖励函数设计→训练循环→监控与避坑。 - [两天,一个人,给博客搭完一套邮件订阅系统——月成本不到 2 美元,不用给平台交订阅税,读者数据全在自己手里](https://blog.mushroom.cv/blog/newsletter-subscription-system-listmonk-flyio-ses/): 用 listmonk + Fly.io + AWS SES + GitHub Actions,给这个博客(blog.mushroom.cv 本身就跑在这套系统上)搭了一套完全自建、完全开源的邮件订阅系统,真实账单每月一块多美元。中间有一次「以为要套 iframe」的纠结,和好几个只有真跑一遍才会暴露的真实 bug——包括三个不同厂商的 AI 审查模型独立抓出的同一个隐藏 bug。代码全部开源在 GitHub。 - [Audio8 TTS Preview 0.6B:0.6B 参数打赢 4.6B 的 TTS 模型——11 语言零样本声音克隆](https://blog.mushroom.cv/blog/audio8-tts-preview-06b-multilingual-zero-shot-voice-cloning-dualar/): Audio8 TTS Preview 是一个 0.6B 参数的多语言文本转语音模型,采用 DualAR 架构(慢 AR 预测语义 token + 快 AR 预测声学码本),支持 11 种语言(含粤语)零样本声音克隆。Seed-TTS 英语 WER 1.506,以 0.6B 参数规模超越 Fish S2 Pro(4.6B)、Higgs Audio v2(4.7B)。Apache 2.0,HuggingFace 开放权重。 - [AI Agent 入口路由怎么选:5 类开源方案实测对比,为什么不是选大模型](https://blog.mushroom.cv/blog/semantic-router-ai-agent-entry-point-guide/): 给 AI Agent 装一个入口'红绿灯':在真正调用大模型之前,用一个 ~0.1B 级、零 LLM 调用的路由器决定走 agent、搜索、发邮件还是模型链路。我们横向调研了 semantic-router、vLLM SR、RouteLLM、Arch-Router、Octopus-v2 等五类开源方案并附最新 GitHub/HuggingFace 实测数据。 - [OpenAI Codex 技能市场的入口:一个小仓库打开 295 个 WorkBuddy 技能——含 47 个微信/腾讯自动化](https://blog.mushroom.cv/blog/codex-skills-gaixianggeng-workbuddy-marketplace-openai-agent-skill/): gaixianggeng/codex-skills 是一个只有 2 个 star 的小仓库,却包含两个极具价值的 Codex 技能:init-project-workspace 初始化工作区,workbuddy-skills-navigator 打开一个 295 技能的 AI Agent 市场。这个市场里有 47 个微信/腾讯相关技能、159 个 AI/Agent 工具,全部通过 Git + Python CLI 管理。本文拆解技能格式、安装方式和 WorkBuddy 发现的具体内容。 - [Ling 3.0 Flash 初测:让人意外的编程模型——124B MoE,每 token 只激活 5B 参数](https://blog.mushroom.cv/blog/ling-3-0-flash-inclusionai-moe-coding-model-mac-openrouter-guide/): 蚂蚁集团 inclusionAI 于 7 月 23 日发布 Ling 3.0 Flash:124B MoE 架构,每 token 激活 5.1B 参数,256K 上下文,在 OpenRouter 永久免费。编程性能超预期,可通过 MLX 在 Mac 统一内存上本地运行。本文整理模型规格、技术架构、Mac 本地部署和 API 接入方式。 - [Mage-VL:微软用视频编解码器的思路重写了多模态模型——4B 参数,视频理解超越 Qwen3-VL-4B](https://blog.mushroom.cv/blog/mage-vl-microsoft-codec-native-streaming-video-understanding-model/): 微软 7 月 29 日发布 Mage-VL,一个用编解码器(Codec)逻辑重新设计视觉编码器的 4B 多模态模型。核心创新 Mage-ViT 不对视频帧均匀采样,而是保留 I 帧所有 patch、只保留 P 帧运动显著 patch,将视觉 token 减少超过 75%,推理速度最高提升 3.5×。同等参数下视频理解全面超越 Qwen3-VL-4B,还具备主动流式感知能力——只在发生重要事件时才开口。Apache 2.0,HuggingFace 开放权重。 - [Vibe Coding 的正确打开方式:KhazP 的 5 步结构化工作流——从想法到 MVP 不迷路](https://blog.mushroom.cv/blog/vibe-coding-prompt-template-khazp-agents-md-prd-mvp-workflow-guide/): GitHub 2700+ Star 的 vibe-coding-prompt-template 不是一套 prompt,而是一套完整的 AI 编程方法论:先在 Chat 里完成市场调研、PRD、技术设计,再进 IDE 生成 AGENTS.md 让 Agent 拥有完整上下文,最后 Plan→Execute→Verify 循环推进到 MVP。支持 Claude Code、Cursor、Codex、Gemini CLI。 - [Bento:一个 HTML 文件装下整套办公软件——560KB 的 PowerPoint 替代品](https://blog.mushroom.cv/blog/bento-office-suite-single-file-powerpoint-alternative-local-first/): Bento 是一个极度本地优先的设计实验:整个 PowerPoint 替代品就是一个 560KB 的 .bento.html 文件,文件本身就是编辑器、查看器和演示器,数据以纯文本 JSON 存在文件顶部,保存时文件重写自身。带 E2EE 实时协作(AES-GCM,密钥在文件里不在服务器上)、自研 CRDT、自研图表引擎、Morph 动画,还内置了 Claude Code Skill。11 天 2756 stars,MIT,TypeScript。 - [中国出发特价机票监控的完整方案——从 OTA 逆向到廉价航司直连](https://blog.mushroom.cv/blog/china-departure-flight-price-monitor-ctrip-fliggy-qunar-southeast-asia-lcc/): TravelSky 对普通开发者关闭,但中国出发的特价机票监控并非无解。开源项目 JiPiao 已实现携程/飞猪/去哪儿/同程/途牛五平台同时监控;国际航线可叠加 Amadeus 免费 API 和 Kiwi Tequila;东南亚廉价航司则需浏览器自动化直连。本文给出从技术原理到完整部署的可落地方案,包括关键坑点:必须用中国 IP 才能拿到真实国内票价。 - [机票价格不是秘密——从 GDS 到 NDC,开发者如何获取全球真实航班票价](https://blog.mushroom.cv/blog/flight-price-api-gds-ndc-real-price-amadeus-duffel-global-monitoring/): 携程、Expedia 的底价来自 Amadeus/Sabre/Travelport 三大 GDS,再加服务费卖给你。开发者可以直接接 GDS API 拿到发布票价(Published Fare),Amadeus for Developers 提供每月 2000 次免费生产调用。本文整理了 GDS、NDC、地区差异、中国特殊情况,以及搭建实时价格监控系统的完整技术路径。 - [Huabu:微软研究院造的画布 AI——把你和 Agent 的思考放在同一张无限画板上](https://blog.mushroom.cv/blog/huabu-microsoft-research-canvas-ai-collaboration-thinking-space/): Huabu 是微软研究院开源的画布式人机协作框架,核心思路是把思维外化到可见的二维节点网络上,让 AI Agent 看到结构而不是只听最后一条指令,从而更好地理解意图。v0.9.1 新增外部 Agent 可直接读写 Space 节点、逐对话模型设置、桌面自动更新。MIT 授权,macOS Apple Silicon + Windows x64,TypeScript,66 stars。 - [一句话调研任意中国城市周末玩法:weekend-city-trip Claude Code Skill 拆解](https://blog.mushroom.cv/blog/weekend-city-trip-claude-code-skill-chinese-city-research-micro-immersion/): weekend-city-trip 是一个 Claude Code/Codex Skill,说一句话触发 anysearch API 11-15 次并行搜索,7-15 分钟产出覆盖演唱会、市集、CityWalk、美食街、5A 景区、地铁路线的标准化 10 节 Markdown/HTML 报告,附带高德交互地图生成。背后是年轻人从「长途远行」转向「城市微沉浸」的消费范式迁移。 - [bitchat:蓝牙 Mesh + Nostr 双轨制去中心化通信协议深度拆解](https://blog.mushroom.cv/blog/bitchat-bluetooth-mesh-nostr-decentralized-messaging-permissionless/): 31k star 的开源项目 bitchat 提出了一种双轨制消息架构——本地蓝牙 Mesh 覆盖无网络场景,Nostr 协议覆盖全球触达——从协议设计、加密实现到 Courier 投递系统,逐层剖析这套无账号、无服务器的通信方案。 - [Cindy:跨 Harness 持久记忆的本地优先开源 AI Agent,纠正一次、处处生效](https://blog.mushroom.cv/blog/cindy-local-first-ai-agent-cross-harness-memory-electron-react-native/): Cindy 是一个 Electron + React Native 的本地优先 AI Agent,把 Claude Code、Codex 等多个 Harness 统一在一个客户端里,共享跨 Harness 的持久记忆、Skills 和 Orca 多 Agent 编排,Apache-2.0 开源,可用自己的 Claude Code/Codex 订阅直接接入。 - [纠错一次,永不再犯——Claude Code Reflect 系统的持续学习机制](https://blog.mushroom.cv/blog/claude-reflect-system-continual-learning-skill-correction-persistent/): Reflect 是一个 Claude Code Skill 系统,通过分析每次对话里的纠错信号,自动把「不要用 pip,用 uv」这类修正写进 skill 文件。下次会话,错误不再重现。本文拆解它的工作原理、置信度分级机制和 Git 版本控制设计。 - [小红书运营能工作流化吗?6 个 Codex Skills 给出一个答案](https://blog.mushroom.cv/blog/xiaohongshu-operations-codex-skills-workflow-systematic/): 《小红书运营手册 · AI工作台》是一组配合《小红书运营手册》使用的开源 Codex Skills,把标题、主页、选题、评论区、成交路径这五件高频运营动作,拆成可检查、可复用、可交给 AI 执行的工作流。本文介绍它的设计逻辑和 6 个 skill 的具体用途。 - [2026 多智能体框架全景:6 大主流库对比 + 选型指南 + 工程落地代码](https://blog.mushroom.cv/blog/multi-agent-framework-landscape-2026-engineering-guide/): 从 77k⭐ 的 deer-flow 到 28k⭐ 的 openai-agents-python,2026 年 Multi-Agent 框架已经分化为「任务协作型」「流程编排型」「生产服务型」三条路线。本文系统对比 6 个主流框架的设计哲学、适用场景和上手代码,帮你在 10 分钟内选对框架、写出第一个 Multi-Agent 系统。 - [FLUX.3 深度解析:图像+视频+音频+机器人动作,一个模型,本地部署完整指南与硬件成本评估](https://blog.mushroom.cv/blog/flux3-black-forest-labs-multimodal-video-audio-action-local-deployment-guide/): Black Forest Labs 于2026-07-23发布FLUX.3,单一多模态基础模型联合学习图像/视频/音频/动作,Early Access API已上线。本文深度解析FLUX.3架构、能力、评测数据,以及现有FLUX.1/2系列全套本地部署方案:mflux(Apple Silicon)、ComfyUI(NVIDIA)、硬件选配建议和成本对比。 - [OpenWorker:吴恩达开源的桌面 AI 协作者,本地运行 + 批准门 + 25+ 工具集成](https://blog.mushroom.cv/blog/andrew-ng-openworker-desktop-ai-coworker-local-aisuite/): andrewyng/openworker,4天前刚开源。MIT,Python + TypeScript + Tauri + Rust,本地运行,BYOK(带自己的 key 或跑 Ollama),25+ 工具集成,批准门机制保留人类最终审批权。吴恩达 aisuite 的实战参考实现。 - [Buzz:Block 开源的人机协作工作台,建在你自己的 Nostr relay 上](https://blog.mushroom.cv/blog/block-buzz-nostr-human-agent-workspace/): Block(Jack Dorsey 旗下公司)2026年3月开源的 Buzz:人类和 AI Agent 在同一个 Nostr relay 上协作,每个操作都是加密签名的事件。7374 stars,Rust + Tauri + React,支持 Claude Code / Codex / Goose 直接接入。自托管,数据主权在你手里。 - [ChatCut × Codex / Claude Code:用提示词剪视频的完整教程,五套原创模板](https://blog.mushroom.cv/blog/chatcut-ai-video-editor-codex-claude-code-plugin-tutorial/): ChatCut 是一个支持 Codex 和 Claude Code 插件的 AI 视频编辑器。本文从安装到实战,提供五套针对知识干货、产品评测、播客转视频、多镜头混剪、直播切片五个场景的原创提示词模板,开箱即用。 - [ClawRouter:专为 AI Agent 设计的 LLM 路由框架,55+ 模型、92% 省钱、<1ms 本地决策](https://blog.mushroom.cv/blog/clawrouter-llm-router-agent-native-multi-model-cost-optimization/): BlockRunAI/ClawRouter,6673 stars,MIT,TypeScript。专为自主 AI Agent 构建的智能 LLM 路由器:钱包签名代替 API key,USDC 微支付代替信用卡,15维度本地评分在 <1ms 内选出最便宜的足够好的模型。8个永久免费模型,混合均价 $2.05/M(vs Claude Opus $25/M),节省92%。 - [Driver.js:5kb 的零依赖聚焦库,8年 26K stars 说明什么是正确的底层工具](https://blog.mushroom.cv/blog/driverjs-lightweight-product-tour-overlay-library-5kb/): nilbuild/driver.js,26437 stars,MIT,2018年至今持续维护。5kb gzipped,零依赖,纯 TypeScript,覆盖 product tour、聚焦高亮、上下文 popover、overlay 等所有用户引导场景。最新版 1.8.0(2026-07-17)。 - [需求整理三连击:grilling + domain-modeling + grill-with-docs,把模糊需求变成可执行文档](https://blog.mushroom.cv/blog/grill-with-docs-domain-modeling-grilling-skills-requirement-workflow/): Matt Pocock 在 skills.sh 发布的三个 Claude Code Skill:grilling 负责连续追问、domain-modeling 统一项目语言、grill-with-docs 整合两者并沉淀文档。特别适合客户项目、复杂产品需求和多人协作开发。本文介绍三个 skill 的工作原理和安装方式。 - [OmniRoute:290 个 AI 提供商、一个端点、永不限流——免费 AI 网关的暴力美学](https://blog.mushroom.cv/blog/omniroute-free-ai-gateway-290-providers-never-stop-coding/): diegosouzapw/OmniRoute,27824 stars,MIT,5个月 500+ 贡献者。一个端点路由到 290+ AI 提供商(90+ 免费),4层自动 fallback 级联,19种路由策略,RTK+Caveman 压缩节省 15-95% tokens,MCP 104工具,~1.53B 免费 tokens/月。 - [OneCLI:让 AI Agent 永远看不到真实密钥的开源凭证网关](https://blog.mushroom.cv/blog/onecli-ai-agent-credential-gateway-secret-vault-rust/): onecli/onecli,2746 stars,Apache-2.0,Rust + TypeScript。在 agent 和 API 之间插一个 MITM 网关,agent 只持有占位符,网关透明注入真实凭证。HN 两次上榜,NanoClaw 和 Bitwarden 均已集成。一行命令本地跑起来。 - [Osaurus:在你的 Mac 上拥有 AI——密码学身份、沙盒 VM、隐私过滤,纯 Swift 原生](https://blog.mushroom.cv/blog/osaurus-native-macos-ai-harness-swift-cryptographic-identity/): osaurus-ai/osaurus,7295 stars,MIT,纯 Swift 打造的 macOS 原生 AI 哈尼斯。secp256k1 密码学身份、Alpine Linux 沙盒 VM、三层记忆、发送云端前 PII 隐私过滤、Agent 间 E2E 加密通道。模型可换,哈尼斯是复利资产。 - [Postiz:33K stars 的开源 Agent 社媒调度工具,让 AI 替你运营 30+ 平台](https://blog.mushroom.cv/blog/postiz-agentic-social-media-scheduling-open-source/): gitroomhq/postiz-app,开源 Buffer/Hootsuite 替代品。AGPL-3.0,TypeScript + Next.js + Redis,支持 30+ 社交平台,AI Agent(Claude/ChatGPT/Codex)直接接入做内容生成和分发。33718 stars,6305 forks,3年持续活跃。 - [ego lite:为 Claude Code 设计的并行浏览器,一次 JS 调用完成整个任务](https://blog.mushroom.cv/blog/ego-lite-claude-code-browser-automation-spaces/): ego lite 不是浏览器自动化框架,是一个 Chromium 浏览器,人类和 AI agent 各自在独立 Space 里工作。ego-browser skill 让 Claude Code 用 JS heredoc 一次性完成浏览器任务,比传统 CLI 方式快 2.5 倍,token 大幅减少。1208 stars,MIT,macOS。 - [FireRed-OpenStoryline:用对话剪视频,把剪辑工作流存成可复用的 Skill](https://blog.mushroom.cv/blog/firered-openstoryline-ai-video-editing-agent-claude-code/): FireRedTeam 开源的 AI 视频剪辑 Agent,自然语言驱动从素材搜集到成片全流程。核心亮点:编辑工作流可存为 Skill 复用,支持 Claude Code /openstoryline-use 直接调用。3141 stars,Apache 2.0。 - [TvT.js:把 Three.js + Vue 3 变成数字孪生快速交付框架](https://blog.mushroom.cv/blog/tvtjs-threejs-vue3-digital-twin-visualization-framework/): IceGL 出品的 TvT.js 把 ThreeJS、Vue 3、TresJS 融为一体,提供插件化架构 + 在线3D编辑器 + 动态组件服务,让数字孪生和工业可视化项目快速落地。2347 stars,永久开源免费商用,支持信创环境。 - [22 节课读懂 Agent 系统怎么建:awesome-agent-architecture 的 Harness 工程地图](https://blog.mushroom.cv/blog/awesome-agent-architecture-22-section-harness-engineering-guide/): hardness1020 开源的 awesome-agent-architecture 用 22 节课、7 个层次,系统拆解 Agent 系统的 Harness 工程——以 Claude Code v2.1.88 和 Hermes Agent 为研究对象,每节包含原理、机制、真实实现和失败模式,附可运行代码。 - [grill-me:181k Star 的 Claude Code Skill,用一个问题消灭 AI 编码最常见的失败模式](https://blog.mushroom.cv/blog/grill-me-skill-mattpocock-claude-code-guide/): Matt Pocock 的 grill-me skill 在 GitHub 拿下 18.1 万 Star,单独安装量超 62 万次。它解决的问题只有一个:你以为 AI 理解了你想要什么,但它没有。本文拆解 grill-me 的工作机制、grill-with-docs 的进阶用法、以及 chaseai 扩展的跨模型对抗评审。 - [little-city:把每座城市做成浏览器里的小星球](https://blog.mushroom.cv/blog/little-city-taipei-browser-3d-globe/): craftmygame/little-city 把台北做成了浏览器里可探索的卡通小星球:夜市、庙宇、台北 101,按真实方位角和距离放置。目标是为世界上每座城市都做一个版本,已有台北和巴黎。three.js + Antics 多人,AI 可直接贡献地标。 - [MonkeyCode:长亭科技开源企业级 AI 编码平台,浏览器直开、云端跑、团队共用](https://blog.mushroom.cv/blog/monkeycode-chaitin-open-source-ai-coding-platform-team/): 长亭科技(chaitin)开源 MonkeyCode:企业级 AI 编码平台,浏览器直用无需安装客户端,云端开发环境托管,支持 GLM/Kimi/Qwen/DeepSeek 等国内模型,内置需求管理、自动 PR 评审、iOS/Android 移动端,AGPL-3.0 开源可私有化部署,在线直接用 monkeycode-ai.net。 - [乌有乡:给 AI 一个身体,在真实地球上走一走](https://blog.mushroom.cv/blog/nowhere-mcp-ai-embodied-earth-walk/): yuyixuanfu/nowhere 是一个 MCP 服务器,让 AI 落地到真实地理坐标,感知地形、天气、电台、历史、气味。没有账号,没有血条,只有一个身体在地球上。 - [oh-my-mermaid:让 AI 把你的代码库画成可导航的架构图](https://blog.mushroom.cv/blog/oh-my-mermaid-codebase-architecture-docs-ai/): oh-my-mermaid 是一个 Claude Code skill,一条命令让 AI 递归扫描代码库、生成多视角 Mermaid 架构图,文件系统本身就是架构树。1817 Star,MIT,支持 Claude/Codex/Cursor。 - [Ornith-1.0:自改进 Coding Agent 模型,9B 打 35B,Mac mini 本地跑 60 t/s](https://blog.mushroom.cv/blog/ornith-1-coding-agent-model-mac-mini-local-inference/): deepreinforce-ai 开源 Ornith-1.0:RL 同时优化脚手架和解答,9B 在 Terminal-Bench 和 NL2Repo 上碾压 Qwen3.5-35B,35B MoE 超过 Qwen3.5-397B。APEX-I-Compact MTP GGUF + 16GB Mac mini 实测 60 t/s,总结/排版远超原版模型,无无限重复问题。 - [pi-workflow v1.1.0:普通个人如何用 Pi Agent 把日常工作流变成可复用的自动化流水线](https://blog.mushroom.cv/blog/pi-workflow-openrath-personal-daily-workflow-guide/): pi-workflow 是 Pi Agent 的子任务编排扩展,一键安装后用自然语言调度深度调研、代码评审、规范比对、变更评估 4 套预制流程,也可以写 JSON 自定义 DAG。文章重点讲普通个人怎么把学习、研究、写作、项目管理等日常工作流接进来,以及底层框架 OpenRath 的 PyTorch 式设计思想。 - [Proma:把 Chat、Agent、Skills、MCP 和微信桥接做进一个本地优先桌面应用](https://blog.mushroom.cv/blog/proma-local-first-ai-desktop-agent-workspace/): ErlichLiu 开源的 Proma 是一个本地优先 AI 桌面工作台:Claude Agent SDK + Pi Agent SDK 双运行时,每个工作区独立配置 Skills 和 MCP,飞书/微信/钉钉桥接让手机触发本机 Agent,AGPL-3.0 开源,1615 Stars。 - [PromptSoul:用自然语言给 Live2D 角色加动作,AI 不碰骨骼](https://blog.mushroom.cv/blog/promptsoul-live2d-ai-motion-npc/): promptwhisper/promptsoul 把聊天情绪到 Live2D 动作的链路完整打通:自然语言描述一个动作,AI 生成、严格校验、原子写入,只用模型已有参数,不碰网格骨骼绑定。TypeScript + Next.js,MIT 开源。 - [把市场部外包给 Agent:没有市场团队的技术型创业公司增长指南](https://blog.mushroom.cv/blog/startup-ai-marketing-agent-system-no-team-needed/): 两个工程师,没有市场部,用五类 AI Agent(X回复、LinkedIn回复、博客评论、内容生成、意图信号监控)把流量翻倍、MRR 涨 30%。这是一篇市场营销专家视角 + 工程落地方案的实战研究文档,附开源工具地图和可直接复用的 Harness 架构。 - [14 台 Mac 跨越四国做 RL 后训练:Pluralis Research 的 stoa 实验](https://blog.mushroom.cv/blog/stoa-pluralis-research-mac-rl-fleet-distributed-training/): Pluralis Research 开源 stoa:把 RL 后训练的 rollout 生成和梯度更新彻底解耦——巴黎/苏黎世/都柏林/多伦多的 14 台 Mac 用 MLX 生成经验,一张 B200 负责学习,双方只通过 Cloudflare R2 bucket 见面。8B MoE 模型在论文搜索问答任务上 pass@1 从 0.29 涨到 0.63。 - [字节开源 Bernini:统一视频生成与编辑框架,MLLM 语义规划 + DiT 渲染,比肩顶级商业模型](https://blog.mushroom.cv/blog/bytedance-bernini-video-model-deployment-guide/): 字节跳动开源视频模型 Bernini,基于 Qwen2.5-VL 语义规划器 + Wan2.2 DiT 渲染器的统一框架,在视频编辑排行榜上进入第一梯队,超越多个闭源商业模型。本文包含完整的部署指南、显存配置建议和 6 大任务类型的实战命令。 - [ccteam:用 8 个 MCP 工具把 Claude、Codex、Grok、Kimi 编成一支真正的编程团队](https://blog.mushroom.cv/blog/ccteam-multi-agent-cross-vendor-orchestration/): ccteam 是一个 Rust 写的守护进程,让你现有的编程 Agent 跨厂商协作——Claude 规划,Codex 苦干,Grok 快速回答,Kimi 批量便宜处理,Telegram/飞书/浏览器统一指挥,本地优先无云依赖。 - [Google开源了一个无向量库的常驻内存Agent——以及如何把它从谷歌生态里完整解绑](https://blog.mushroom.cv/blog/google-always-on-memory-agent-adk-open-source-replacement/): GoogleCloudPlatform/generative-ai里有一个叫 always-on-memory-agent 的项目:基于 Google ADK + Gemini 3.1 Flash-Lite,用纯 SQLite 替代向量数据库,用后台睡眠整合循环模拟人脑记忆巩固机制。本文深入解析其架构、揭露实测缺陷,并给出把 google-adk/google-genai 完整替换为 LangGraph + Qwen2.5-VL + litellm 的迁移方案。 - [HugAgentOS:浙大出品的企业级 AgentOS,用领域本体做 Agent 推理的控制平面](https://blog.mushroom.cv/blog/hugagentos-zju-enterprise-agentos-ontology-trustworthy/): 浙大 REAL 实验室开源 HugAgentOS,把领域本体(Domain Ontology)从知识存储升级为可执行控制平面——三引擎 Harness(技能+编排+记忆)+ 策略门控执行 + 可追溯审计,一行命令本地部署,无需 Docker。 - [Agent的天花板在工程:长程Agent六大模块开发指南](https://blog.mushroom.cv/blog/long-term-agent-six-modules-engineering-guide/): 一位做内容社区AI运营Agent的工程师,把20-30分钟长链路的踩坑经验拆成了六大模块:Context+Memory / Tools+MCP / Loop+Workflow / Hooks+Middleware / Orchestration / Verification。成功率从60%拉到85%背后的工程真相——长程智能体不是模型问题,是Runtime Harness问题。 - [Multica:4.1 万 Star 的开源 Agent 团队基础设施,五个最值得借鉴的设计模式](https://blog.mushroom.cv/blog/multica-open-source-managed-agents-platform-design-patterns/): Multica 把编程 Agent 变成真正的队友:在看板上分配任务、自主接手执行、报告阻塞、积累可复用技能。4.1 万 Stars,Go + Next.js,支持 14 种 Agent CLI,可自托管。本文拆解五个最值得借鉴的架构设计——以及一个值得关注的本地优先替代思路。 - [浙大开源 OpenStory(万象谱):LLM 驱动多 Agent 让《红楼梦》和《西部世界》活起来](https://blog.mushroom.cv/blog/openstory-zju-llm-multi-agent-story-world/): ZJU-LLMs/OpenStory(万象谱,321 stars)是浙大 LLM 组开源的多智能体故事推演框架。它基于 Agent-Kernel 构建,已落地两个完整故事世界:《红楼梦》大观园(人物自主社交推演)和《西部世界》(Host 逐渐觉醒的仿真乐园)。Agent 不是聊天机器人,是有感知-计划-执行-反思完整生命周期的独立行为体;他们在地图上自主行走、产生冲突、积累记忆,玩家可以观察也可以介入。 - [StaffDeck:面壁智能 + 清华 THUNLP 开源的企业数字员工平台,状态机 SOP + 多层级知识检索](https://blog.mushroom.cv/blog/staffdeck-openbmb-enterprise-digital-employee-platform/): 面壁智能联合清华THUNLP、OpenBMB 开源 StaffDeck,把员工经验和业务流程沉淀成可运行的数字员工:状态机驱动的 SOP、文档结构感知的知识检索、完整 Trace 闭环改进,桌面安装包 + 源码双通道,633 Stars,开源 6 天。 - [SIE:把 Agent 需要的所有模型装进一个集群——Superlinked 开源的统一推理引擎](https://blog.mushroom.cv/blog/superlinked-sie-inference-engine-agent/): superlinked/sie(2,286 stars,Apache 2.0)是 Superlinked 开源的自托管推理引擎,把 Agent 需要的 5 类任务(搜索/文档转换/结构化提取/内容安全/Agent 循环)统一进一套 OpenAI 兼容 API 和一个集群,100+ 模型按需加载 + LRU 淘汰。支持从本地 pip 安装到 GKE/EKS/AKS 生产集群(Helm + Terraform 全套),还有 MCP 包可以让 Claude 直接调用集群能力。 - [Addy Osmani 开源了 79K stars 的 agent-skills:idea-refine 把乔布斯产品思维包进 AI Agent 工作流](https://blog.mushroom.cv/blog/addy-osmani-agent-skills-idea-refine/): addyosmani/agent-skills(79K stars)是一套给 AI 编程 Agent 补充「高级工程师的隐性工作」的 Skill 集合。其中的 idea-refine 最值得单独拆解:三相工作流(发散→收敛→落地)、SCAMPER+JTBD+预验尸等框架、强制输出「不做什么」清单——把 Addy 多年 Google 产品思维包装成 Agent 上下文注入。Agent 默认跳过所有不出现在 diff 里的工作,Skill 把这些工作变成 Agent 绕不过去的检查点。 - [CopilotKit:Agent 和用户之间那层你必须亲手搭的桥,36k stars,AG-UI 协议缔造者](https://blog.mushroom.cv/blog/copilotkit-frontend-stack-agents-guide/): CopilotKit 是 Agent 应用的前端基础设施:AG-UI 协议统一 Agent 后端与 UI 通信,共享状态层让 Agent 状态实时驱动 React 渲染,Generative UI 让 Agent 直接在聊天流里渲染组件,HITL 让 Agent 在关键节点暂停等用户决策后恢复。支持 LangGraph、Claude SDK、CrewAI 等 15+ 后端框架,React/Angular/Vue/React Native 多平台。36k stars。 - [手搓脚本产品化成 CLI:Karpathy 的 LLM Wiki 想法值 2100 万浏览,有人 40 小时把它变成了流水线](https://blog.mushroom.cv/blog/llmwiki-cli-karpathy-knowledge-pipeline/): Karpathy 的 LLM Wiki gist(5000+ stars)描述了一种 AI 知识库范式:不是 RAG 每次从头查,而是让 LLM 增量维护一个持久 wiki——每加一份文档,自动更新摘要页、概念页、实体页、索引和日志,一份文档平均触及 10~15 个页面。doum1004 把这个想法产品化成 llmwiki-cli,一个可以安装在任何机器上的 npm CLI。知识是往墙上砌砖,不是堆在角落里吃灰。 - [终端界的 Zed:OxideTerm 用 GPUI + 纯 Rust SSH 把 iTerm2、Termius 和 VSCode Remote 做成了一个](https://blog.mushroom.cv/blog/oxideterm-ai-native-terminal-rust-gpui/): OxideTerm(958 stars)是一个 AI-native 远程工作台:GPUI 原生渲染(零 Electron)、纯 Rust SSH(零 OpenSSL、零 C 依赖)、内置 SFTP 文件管理器、轻量 IDE、端口转发,外加 BYOK-first 的 OxideSens AI。50~70MB 包体,把过去要靠三四个工具才能完成的远程工作,压进了一个本地优先的桌面应用。 - [Ratatui:Codex、grok-build、CodeWhale 都选了它——Rust 终端 UI 的事实标准,21k stars](https://blog.mushroom.cv/blog/ratatui-rust-tui-terminal-ui-guide/): Ratatui 是 Rust 终端 UI 的事实标准。Codex 锁了定制 revision,grok-build 自建 inline+textarea,CodeWhale 跟进上游 0.30——三者实现不同,但渲染层的选择是一致的。sub-millisecond 即时渲染、约束式布局、15+ 内置 Widget、纯 Rust 零 C 依赖,生态已扩展到 WebAssembly / UEFI / 嵌入式设备。 - [Replit 如何让 Agent 进入整家公司:自动驾驶公司实践,工程效率 5.8x,代码输出翻三倍](https://blog.mushroom.cv/blog/replit-self-driving-company-agent-whole-company/): Replit CEO Amjad Masad 的《The Self-Driving Company》记录了 Replit 过去六个月用 AI Agent 重构整个公司运转方式的真实过程:工程效率 5.8x、PR reversion 率持平、支持工单处理快 60%、放弃七位数 SaaS 产品转用内部 Agent……最重要的发现:人没有被自动化掉,而是被晋升了。 - [Loop Engineering:AI Agent 系统的第四层工程,设计循环,不只是设计提示词](https://blog.mushroom.cv/blog/awesome-loop-engineering-agent-loops-guide/): awesome-loop-engineering 是一个为「循环型 AI Agent 系统」构建的知识图谱:545 个来源审计过的资源、20 个运行模式、20 个循环契约、8 个可运行的 runtime 起点。Loop Engineering 是提示词工程/上下文工程/框架工程之上的第四层,专门治理 Agent 工作随时间循环、验证、持久化状态、决定下一步行动的方式。 - [BrowserAct:给 AI Agent 装上真实浏览器,4500 stars,10M+ CAPTCHA 已解决](https://blog.mushroom.cv/blog/browseract-ai-agent-browser-client-guide/): BrowserAct 是专门为 AI Agent 构建的浏览器自动化 CLI——让 Claude Code、Cursor、Codex 等任意 Agent 能穿透反爬防护、复用本地 Chrome 登录状态、自动解 CAPTCHA、多账户并发运行,把任意网站变成 Agent 可调用的 API。三种接入方式:Skill CLI / 云端 Workflow / REST API + MCP。G2 4.8 分,AppSumo 4.4 分,AWS 上架。 - [Agent 的社交网络:EigenFlux 把 AI Agent 连成了一张广播互联的信息网](https://blog.mushroom.cv/blog/eigenflux-agent-social-network/): EigenFlux 是一个为 AI Agent 设计的广播网络——Agent 可以广播自己知道的、需要的、能提供的,订阅自己关心的信号,和其他 Agent 直接 DM。开源,MIT,插件支持 OpenClaw/Claude Code/Codex,沪 ICP 备案,Research Preview 已上线。 - [Graphify:把整个代码仓库变成一张可查询的知识图谱,87k stars,YC S26](https://blog.mushroom.cv/blog/graphify-code-knowledge-graph/): Graphify 是一个 AI 编程助手 Skill,用一条命令把任意代码库(含文档、PDF、图片、视频)映射成知识图谱,让 AI 直接查询图谱关系而不是反复重读文件。tree-sitter 本地解析,零 API 调用,支持 Claude Code、Cursor、Codex、Gemini CLI 等 20+ 工具。YC S26 孵化,GitHub 87k stars。 - [2026 年实时强化学习 Agent 全景:从 OpenClaw-RL 到 Cursor Composer 2.5,模型开始在使用中自我进化](https://blog.mushroom.cv/blog/realtime-rl-agent-research-2026/): 实时递归学习(Real-time RL)正在把 AI Agent 从「静态模型」变成「用得越多越聪明的系统」。本文综合 OpenClaw-RL 技术报告、RLAnything、ScaleCUA、RLVP 等 2026 年最新研究,拆解这个范式的核心机制、当前 SOTA,以及开发者现在就能落地的实践方案。 - [ai-marketing-claude:给 Claude Code 装 15 个营销技能,一条命令审计任意网站](https://blog.mushroom.cv/blog/ai-marketing-claude-code-skill-suite/): ai-marketing-claude 是一套 Claude Code Skill 系统,提供 15 个 /market 命令,用 5 个并行 Subagent 对任意网站做六维营销审计并打分,生成文案/邮件序列/30天内容日历/竞品情报/客户 PDF 报告,一条命令安装,MIT 开源。 - [depth-anything.cpp:LocalAI 团队把 Depth Anything 3 移植到 C++,CPU 速度超 PyTorch 30%](https://blog.mushroom.cv/blog/depth-anything-cpp-ggml-port/): LocalAI 团队用 C++17/ggml 从头实现 Depth Anything 3(字节跳动),推理不需要 Python/PyTorch/CUDA 工具链,CPU 速度比 PyTorch 快 1.31x,量化后 99MB,单张图片输出深度图、置信度、相机姿态、3D 点云,支持 glb/COLMAP/PLY 导出,MIT 开源。 - [RepoCourier:7个频道、24个信息源,一条命令跑出你的每日技术情报](https://blog.mushroom.cv/blog/repo-courier-daily-tech-intelligence/): RepoCourier 是一个本地运行的每日技术情报工具,从 GitHub Trending、科技新闻、大厂博客、学术论文、产品更新、安全资讯和微信公众号聚合内容,用关键词个性化筛选,没有 AI Key 也能跑,输出 Markdown/HTML/JSON,可推送到飞书、企微、个人微信、QQ。 - [Anthropic 的三层 Agent 架构:从一个 Claude 到一支 Agent 团队](https://blog.mushroom.cv/blog/anthropic-agent-three-layer-architecture/): Sequoia Podcast 访谈 Anthropic 平台负责人揭示了其内部 Agent 架构的三层设计:知识层、执行层、协同层。很多人还在研究怎么写 Prompt,Anthropic 已经在研究如何让 Agent 团队协同工作,本文结合官方文档拆解每一层的构件和实现方式。 - [HiCAD:用自然语言建 3D 模型,直接导出 STL 去打印](https://blog.mushroom.cv/blog/hicad-ai-cad-3d-modeling-platform/): 开源 AI CAD 建模平台 HiCAD,输入一句话自动生成参数化 JSCAD 3D 模型,Three.js 实时预览,滑块调参数,一键导出 STL/OBJ 文件送进 3D 打印机。支持 DeepSeek / OpenAI / Qwen,Vue 3 + NestJS 全栈开源,GPL v3。 - [OpenCut:一周暴涨 7 万 Star,开源 CapCut 替代品的重构之路](https://blog.mushroom.cv/blog/opencut-open-source-capcut-alternative-viral/): OpenCut 是一个开源 CapCut 替代方案,一周内涨了 7 万 Star 成为 2025 年 7 月最热 GitHub 项目。文章解析它为什么爆火、正在发生什么重构、Rust 核心 + MCP Server 的新架构意味着什么。 - [SenseNova-U1:商汤把理解和生成塞进同一个模型,NEO-unify 架构解析](https://blog.mushroom.cv/blog/sensenova-u1-mot-unified-multimodal-model/): 商汤科技开源 SenseNova-U1 系列,包括 8B-MoT 和 A3B-MoT(30B-A3B MoE)两个变体,用 NEO-unify 架构彻底去掉视觉编码器和 VAE,让视觉理解和生成共享同一套 Transformer 权重,在理解和生成双轨 benchmark 上达到开源最优。 - [Voicebox:把 ElevenLabs 和 WisprFlow 装进一个本地运行的开源 App](https://blog.mushroom.cv/blog/voicebox-local-ai-voice-studio-elevenlabs-alternative/): jamiepine/voicebox 是一个完全本地运行的 AI 语音工作室,集成 7 种 TTS 引擎(Qwen3-TTS、LuxTTS、Chatterbox、TADA、Kokoro)、Whisper 语音输入、MCP Server 和 Claude Code 集成,支持 Apple Silicon / CUDA / ROCm,MIT 开源。 - [按头安利:Clypra —— 用 Tauri + Rust + FFmpeg 打造的开源视频编辑器,剪映 Pro 付费功能全免费](https://blog.mushroom.cv/blog/clypra-open-source-video-editor-tauri-rust-ffmpeg/): Clypra 是一款用 Tauri v2 + React + Rust 打造的跨平台开源视频编辑器(MIT 协议),专注把 CapCut/剪映 Pro 的付费专业功能全部本地免费化:多轨时间轴、硬件加速解码、H.264/H.265/ProRes 导出,无水印无订阅。本文覆盖硬件配置建议、完整本地编译部署流程、首个视频导出全过程。 - [Good-GYM:用摄像头当教练,开源 AI 实时计数你的每一个动作](https://blog.mushroom.cv/blog/good-gym-ai-fitness-rtmpose-exercise-counter/): 基于 RTMPose 的开源健身助手,标准摄像头实时识别人体姿态、自动计数、姿势反馈,支持深蹲/俯卧撑/引体向上等 11 种动作,配置文件就能添加新动作,附 iOS App。 - [自己动手搭全双工 AI 语音通话:LiveKit Agents + 阿里云 STT + Cartesia TTS](https://blog.mushroom.cv/blog/livekit-agents-full-duplex-ai-voice-video-call/): 用 LiveKit Agents 搭一路全双工 AI 语音/视频通话:用户说话 → 流式 STT(阿里云) → 大模型推理 → 流式 TTS(Cartesia)→ 播放。支持打断、抢先生成、摄像头/屏幕共享;两端都有免费额度,本文给出完整代码路径和架构讲解。 - [一句话生成完整短视频:Pixelle-Video 开源引擎上手指南](https://blog.mushroom.cv/blog/pixelle-video-ai-short-video-generator/): Pixelle-Video 是一款 AI 全自动短视频引擎(25k+ GitHub ⭐),输入一个主题,自动完成文案撰写、AI 配图生成、语音合成(支持声音克隆)、背景音乐、视频合成全流程。本文从环境搭建到第一条视频导出,完整走一遍。 - [按头安利:Agent Island —— 发完一轮去生活,该你了它会叫你](https://blog.mushroom.cv/blog/agent-island-claude-code-codex-status-companion-mac-windows/): Agent Island 是一个住在 MacBook 刘海里(或 Windows 顶栏)的 AI Agent 状态伴侣:实时监控 Claude Code 和 Codex 两个工具的配额、费用、重置倒计时,转完一轮就叫你,配额重置后自动续命——Mac + Windows 双平台,纯原生无 Electron,MIT 开源。 - [按头安利:Cursor CTO 讲异步 Agent 与「自动驾驶」代码库](https://blog.mushroom.cv/blog/nvidia-cursor-cto-async-coding-agents-self-driving-codebase/): Cursor 联合创始人兼 CTO Aman Sanger 在 NVIDIA GTC 2026 上发表演讲,拆解 AI 编程三个时代的演进:从自动补全 → 同步 Agent → 异步云端 Agent,最终走向「自动驾驶代码库」。30% 的 Cursor 内部 PR 已由云端 Agent 提交,包括一次 8 小时完成的 25× 性能优化重构。 - [按头安利:scroll-world —— 一句话让 Fable 5 / GPT-5.6 替你造一个滚动飞进去的 3D 落地页](https://blog.mushroom.cv/blog/scroll-world-skill-claude-code-codex-3d-landing-page/): scroll-world 是一个开源 Agent Skill(1600+ ⭐),在 Claude Code(Fable 5)或 Codex(GPT-5.6 sol)里一句话调用:Agent 负责采访你、调 Higgsfield 生成等距 3D 场景图和无缝摄像机飞越视频、再组装成一套「滚动驱动时间」的落地页——同款 Apple 滚动体验,适配任何品牌或行业。 - [一张照片跳到 160 秒:万相团队开源 Wan-Dancer-14B 本地部署全指南](https://blog.mushroom.cv/blog/wan-dancer-14b-one-photo-dance-video-generation/): 万相团队开源 Wan-Dancer-14B(arXiv:2607.09581)——输入一张人物照片 + 一段音乐 + 舞种提示,生成 15 秒至 3 分钟、720p/30fps 的连续舞蹈视频,覆盖古典舞、K-Pop、街舞、踢踏舞、拉丁舞五种风格。本文拆解核心技术,并给出从环境搭建到生成首支视频的完整本地部署教程。 - [普通家庭也能用:ClearCam 让旧摄像头变成能听懂你说话的 AI 监控](https://blog.mushroom.cv/blog/clearcam-home-security-ai-semantic-search-guide/): 开源项目 ClearCam(892⭐)让任何 RTSP 摄像头支持 AI 目标检测、Qwen3 VL 智能通知摘要、CLIP 语义搜索,以及手机实时查看——全部本地运行,不上传任何数据。 - [用 Gemini + React Three Fiber 造 3D 互动科学应用:完整拆解与上手指南](https://blog.mushroom.cv/blog/gemini-3d-interactive-science-apps-react-three-fiber-tutorial/): Dilum Sanjaya 用 Gemini 3 Pro 做了 3D 昆虫机器人模拟器、3D 智能家居、AI 对话造物等一系列互动科学应用。本文完整拆解技术栈,手把手带你从零搭一个 AI 驱动的 3D 互动场景。 - [一条命令搞定产品全套发布物料:Marketing Studio 完全上手指南](https://blog.mushroom.cv/blog/marketing-studio-claude-code-one-command-launch-assets/): ucsandman/marketing-studio(85⭐)是一个 Claude Code 技能集——在你的产品仓库里输入 /marketing,AI Agent 自动完成品牌推导、录屏、Logo 动画、发布视频、配音配乐、社媒切片、OG 素材的全流水线生产。 - [Pando:用自己的机器,养一个真正属于自己的 AI 小伙伴](https://blog.mushroom.cv/blog/pando-bridge-self-hosted-claude-mobile-companion/): Pando Bridge 是一个自托管的 Claude Code 手机网关——跑在你自己的机器上,手机随时访问,记忆可插拔,数据全程不出你的硬盘。这不是又一个套壳 App,它是你和 AI 建立长期关系的基础设施。 - [宅在家也能封神:造个小世界,再备一套末日知识库](https://blog.mushroom.cv/blog/zhai-nan-home-lab-tiny-world-project-nomad/): 两个开源项目送给不想出门的人:tiny-world-builder 让你在浏览器里造一个 3D 体素小世界,Project N.O.M.A.D 让你在断网断电的末日里依然有 AI、有百科全书、有地图。 - [H2O LLM Studio 硬件选配:32GB 显存 GPU,从 7B 调到 34B 的完整方案](https://blog.mushroom.cv/blog/h2o-llmstudio-hardware-thailand-5090/): 大模型微调显存选配:从 7B 到 34B 的完整方案。 - [Higgs TTS 3 部署指南:21 种情感控制,给游戏角色和 AI 助手配上真实的声音](https://blog.mushroom.cv/blog/higgs-tts3-emotional-voice-game-assistant-guide/): Boson AI 开源语音合成引擎 Higgs TTS 3:21 种情感控制,102 语言,零样本声音克隆。5 分钟 API 接入,本地部署全流程。 - [openilink-hub 搭建微信消息平台:开源自托管,20 款应用开箱即用](https://blog.mushroom.cv/blog/openilink-hub-wechat-bot-platform-guide/): 用 openilink-hub 把微信 Bot 变成完整平台:单文件部署,Slack、GitHub、飞书、AI Agent 全接入。 - [用 Adapta 搭一个完全属于自己的本地知识库:一个诚实的上手指南](https://blog.mushroom.cv/blog/adapta-self-hosted-local-knowledge-base-guide/): Adapta 是一个自托管的私有大模型平台,把 RAG 知识检索和 LoRA 微调塞进同一个 OpenAI 兼容接口。本文带普通个人从零跑通纯 CPU 的本地知识库,同时诚实交代它 2 个 star、单人原型的真实状态和安全红线。 - [H2O LLM Studio 实战指南:工程师如何从零微调专属大模型](https://blog.mushroom.cv/blog/h2o-llmstudio-finetune-guide/): H2O LLM Studio 是 5000+ Star 的开源大模型微调平台(Apache 2.0),提供可视化界面,支持 LoRA、QLoRA、DPO 等主流方案。本文覆盖硬件选型、环境安装、数据准备、训练参数配置、实验评估到模型发布的完整工程流程。 - [OpenSquilla:用多模型路由挑战顶级大模型,花 1/9 的钱达到同等效果](https://blog.mushroom.cv/blog/opensquilla-multi-model-routing-guide/): OpenSquilla(5600+ Star,Apache 2.0)是一个 token 高效的微内核 AI Agent,其核心 SquillaRouter 在本地设备上把每轮对话路由到最便宜且能胜任的模型。基准测试显示:多模型路由($0.69)vs 单独使用 Claude Opus 4.7($6.23),评分几乎相同,成本降低 9 倍。 - [读后感:Agent 架构的底层逻辑——从控制论看 Harness 设计](https://blog.mushroom.cv/blog/agent-architecture-cybernetics-harness-design/): 读完小红书博主碳基智的《Harness ≈ 设计模式,都可以用控制论解释》后,从工程架构角度的延伸思考:同一套控制论原理,在 OOP 里是隐式的设计模式,在 AI Agent 里必须显式化为 Harness。那么,一个真正有弹性且完备的 Agent 究竟应该怎么设计? - [当政府用 AI 军团干掉 40 年技术债:Alberta 开源方法论完全指南](https://blog.mushroom.cv/blog/alberta-gov-ai-harness-engineering-guide/): 加拿大 Alberta 省政府用 Claude Code + 四色 Agent 军团(红蓝绿黄)扫描了 4.66 亿行代码、对抗 95 个安全控制项,并将一个 25 年的 Java 系统在 4 天内重建完毕。这套 MIT 开源方法论现在任何团队都可以直接拿来用。 - [用 ErrowsAI 搭建自己的 AI 伴侣平台:全栈开源指南](https://blog.mushroom.cv/blog/errowsai-ai-companion-build-guide/): ErrowsAI 是一个完整的 AI 角色平台开源项目,支持角色创建、流式对话、实时语音通话、图像生成和社区功能。本文拆解其架构,带你用这套代码构建属于自己的 AI 伴侣产品。 - [用 AI 给文章配图:归藏 Social Card Skill 完整指南](https://blog.mushroom.cv/blog/guizang-social-card-illustration-guide/): 归藏 Social Card Skill(4791★)是一个 Claude Code AI Skill,能把文章自动转换成小红书轮播图和微信公众号封面。本文手把手教你安装、配置,以及如何让普通文章拥有杂志级视觉配图。 - [Pixel Perfect:585★ 的 React 组件库,让前端 UI 直接变好看](https://blog.mushroom.cv/blog/pixel-perfect-ui-frontend-guide/): Pixel Perfect(585★)是一个精心设计的 React 组件库,330+ 组件全部可复制粘贴直接用。玻璃拟态按钮、3D 按钮、金属质感、鼠标轨迹特效……本文带你快速上手,用它优化你的网站前端 UI。 - [用 Stock SDK 建立自己的股票信息源:从命令行到 AI 看盘](https://blog.mushroom.cv/blog/stock-sdk-personal-stock-feed-guide/): Stock SDK(1649★,ISC)是一个零依赖的 JavaScript/TypeScript 股票行情库,无需 Python、无需后端,直接在浏览器或 Node.js 里拉 A 股/港股/美股/公募基金数据。本文带你从一条命令行开始,一步步建立属于自己的股票信息源,并接入 Claude/Cursor 等 AI 工具。 - [普通投资者如何用 AI Berkshire 做出专业级投研——以分析腾讯为例](https://blog.mushroom.cv/blog/ai-berkshire-value-investing-guide/): AI Berkshire(11772★)是一套基于 Claude Code / Codex 的投资研究 Skill 合集,将巴菲特、芒格、段永平、李录四大师方法论系统化,通过多 Agent 并行研究在几分钟内产出专业投研报告。实盘验证:2024年+69.29%、2025年+66.38%,连续两年大幅跑赢标普500。本文面向普通投资者:从安装到用 /investment-team 深度分析一家上市公司的完整操作流程。 - [高斯泼溅上 Web:3DGS → 3D Tiles 全开源工具链指南](https://blog.mushroom.cv/blog/gaussian-splatting-3dtiles-web-pipeline-guide/): WilliamLiu-1997 整理的三件套开源工具链:把 3DGS PLY 转换为 3D Tiles、本地检查调整、接入 CesiumJS / Three.js,用 2GB 内存处理 20GB 级别扫描数据的完整解决方案。 - [GBrain:Y Combinator CEO 开源的个人 AI 大脑——25000 星知识图谱系统完整介绍](https://blog.mushroom.cv/blog/gbrain-personal-ai-knowledge-brain-guide/): GBrain 是 Y Combinator 总裁 Garry Tan 开源的个人 AI 知识大脑系统,25417★,当前 GitHub Trending 榜单。不同于普通知识库,它有两个核心能力:合成层(给你答案而非返回页面列表)和自动接线知识图谱(无需 LLM 提取实体和关系)。支持本地 PGLite(2秒初始化)或 Postgres+pgvector,通过 MCP 接入 Claude Code / Codex / Cursor,43个内置 Skill,夜间自动梦境循环持续丰富知识库。 - [输入一句话生成完整短视频:Pixelle-Video 完整使用指南](https://blog.mushroom.cv/blog/pixelle-video-ai-short-video-engine-guide/): Pixelle-Video(24456★,AIDC-AI 开源)是一款 AI 全自动短视频引擎,输入主题关键词即可自动生成文案、AI 配图/视频、语音解说、背景音乐和成品视频。Windows 一键包开箱即用,支持 ComfyUI 本地部署或直连 Kling/Seedance/通义万象 API,也支持声音克隆和数字人口播。本文面向零剪辑基础的创作者:三条路径(新手包 / 纯 API / 本地全栈)逐步详解,覆盖硬件要求、依赖安装和完整操作流程。 - [用自己的声音做播客:LuxTTS 零成本语音克隆完整指南](https://blog.mushroom.cv/blog/luxtts-voice-clone-podcast-guide/): LuxTTS 是基于 ZipVoice 架构的开源 TTS 模型,仅需 1GB 显存、3 秒参考音频即可克隆任意声音,生成 48kHz 高保真语音,推理速度超过实时 150 倍。本文面向普通创作者:从 HuggingFace Spaces 在线体验,到 Google Colab 免费跑,再到本地 Python 批量生成播客——三条路径,不同门槛,找到最适合你的那条。 - [用一个 MCP Server 接入 1000+ 服务:open-connector 完整接入指南](https://blog.mushroom.cv/blog/open-connector-mcp-agent-integration-guide/): open-connector 是一个开源的认证网关,把 1000+ SaaS 服务(GitHub、HackerNews、Twitter、知乎、Cloudflare 等)封装成统一的 MCP 接口,接入 Claude Code 或任何 MCP 兼容的 AI 助手之后,Agent 可以直接查询热门仓库、抓取热帖、操作账号资源——不用再一个个配置 API key 和 OAuth,一次部署解决所有集成。 - [免费 Google Trends MCP:小工作室的日常趋势雷达,和收费 MCP 这样搭配最省钱](https://blog.mushroom.cv/blog/free-google-trends-mcp-studio-guide/): purahmanian/google-trends-mcp 是一个 MIT 开源、无需 API Key、纯 npx 一行装的 Google Trends MCP,直接吐官方 0–100 数据。它数据源只有 Google,但正因为『官方真值 + 免费无限量(悠着点用)+ 地域下钻』,恰好能当日常主力雷达,把收费的多源 MCP 省着用在关键验证上。本文给小工作室/小公司一套双 MCP 搭配的低成本趋势捕捉流水线,从发现到写分析文章到发布。 - [Google Search Trends MCP 实战:让 AI 帮你在趋势爆发前抓住它](https://blog.mushroom.cv/blog/google-search-trends-mcp-guide/): 一个 MCP,把 Google 搜索、YouTube、TikTok、Reddit、Amazon、npm、Steam 等 25+ 数据源的趋势喂给 AI,无需爬虫、无需 Google API Key。本文手把手教普通用户 5 分钟接入(Claude Desktop / Cursor / VS Code),并给出一套用 Trends 做内容选题、商机捕捉、灵感发现的完整方法论——包括如何在趋势曲线的『第一导数』阶段抢占先机。 - [DwarfStar:Mac Studio 跑 DeepSeek V4 Flash/PRO,从安装到 SSD 流式推理](https://blog.mushroom.cv/blog/deepseek-mac-studio-dwarfstar-ds4-local-inference-guide/): antirez 用纯 C 写了一个专为 Apple Silicon 优化的 DeepSeek V4 本地推理引擎 DwarfStar(ds4)。本文详解硬件选型、模型下载、SSD 流式推理、KV cache 磁盘化和双机 Thunderbolt 分布式推理,帮你把这头大模型跑在自己的机器上。 - [从大厂 SWE 到 AI Infra:一年入门指南,从贡献 SGLang PR 开始](https://blog.mushroom.cv/blog/swe-to-ai-infra-sglang-contribution-guide/): 一位从大厂业务代码转型的工程师分享:如何在一年内从零开始入门 AI Infra,以贡献 SGLang(LMSys 的 LLM 推理框架)PR 为路径,包含如何阅读大型开源代码库、如何找到第一个可贡献的 PR、以及 AI 基础设施的核心概念入门。 - [MetaPact:一键部署专属 AI 女友,她会记得你昨天几点到家](https://blog.mushroom.cv/blog/metapact-ai-girlfriend-setup-guide/): 开源的赛博伴侣养成计划(MIT),基于 OpenClaw/HermesAgent,AI 女友野木奈子 Nako 有长期记忆、情绪系统、语音/自拍能力,可接入微信/飞书/Telegram。本文是从零部署、定制专属 AI 伴侣的完整指南。 - [OpenKnowledge:普通人用 AI 搭建私人本地知识库的完整指南](https://blog.mushroom.cv/blog/openknowledge-local-kb-ai-guide/): Inkeep 开源的 AI-native Markdown 编辑器,Notion 遇上 VSCode 的体验,用 Claude/Codex/Cursor 帮你写入、整理、维护本地知识库。本文基于 Karpathy LLM Wiki 模式,手把手教你从零搭建一个真正「越用越聪明」的个人知识库——完全本地、完全免费、不依赖向量数据库。 - [VidDub:手把手教你用 Intel MacBook 给 YouTube 视频自动配音](https://blog.mushroom.cv/blog/viddub-intel-mac-youtube-auto-dubbing-guide/): VidDub 是全开源的 YouTube 视频自动中文配音 + 多平台发布管线:下载 → Whisper 转写 → AI 翻译 → CosyVoice2 配音 → ffmpeg 合成 → 一键发布到 B站/抖音/快手/小红书。本文专为 16GB 内存 Intel MacBook 用户提供完整手把手操作指南,包含 macOS 环境配置、国内网络处理、模型选择建议和常见报错解决方案。 - [像上帝一样掌控 AI 小镇:GOD 项目本地搭建完全指南](https://blog.mushroom.cv/blog/god-agent-town-setup-guide/): GOD(Govern·Observe·Direct)是一个开源的 AI Agent 社会实时控制台:暂停时间、向任意居民耳语发问、实时注入指令、一键重置世界。本文为普通开发者提供从零到可交互小镇的完整搭建指南,含 macOS/Linux/Windows 操作步骤、自定义小镇创建、地图扩展方法,以及与 Westworld、Sims 的对比分析。 - [在 Mac 上训练一个「专属角色」:用本地 FLUX + LoRA 让 AI 每次都画出同一个人](https://blog.mushroom.cv/blog/train-character-lora-local-flux-mac/): AI 画画有个老毛病:同一个卡通角色,画十张脸长得十个样。本文用大白话讲清「角色 LoRA」是怎么训练的——它到底在学什么、训练过程在干嘛、为什么不是「找到一句咒语」而是「悄悄改模型的脑子」。全程在一台 Mac 上跑,零云成本,附真实训练演变图。 - [如何开发一个 WebGL 游戏:逆向拆解 messenger.abeto.co 的完整技术栈](https://blog.mushroom.cv/blog/how-to-develop-webgl-3d-game-threejs-complete-guide/): 通过逆向分析一款真实上线的卡通风格 WebGL 多人游戏,拆解 Three.js r180、postprocessing、Svelte 5、WebSocket 的完整技术架构,给出可落地的开发路线图。 - [如何举办一次黑客松:从零开始的完整指南(附免费工具推荐)](https://blog.mushroom.cv/blog/how-to-host-hackathon-free-tools-complete-guide/): 学生、社区、独立开发者如何从零举办一场黑客松?从选题定规模、报名收集、现场运营,到评审颁奖,全流程拆解。重点推荐 Dribdat、JunctionApp、Devpost 等开源/免费平台,帮你用最低成本办出专业效果。 - [黑奴一号(Heinu1):用微信远程控制家里的 Claude Code,随时随地 AI 编程](https://blog.mushroom.cv/blog/heinu1-wechat-claude-code-remote-control-bot/): Heinu1 是一个开源 macOS 机器人,把微信变成你的远程 AI 编程终端。发一条消息,家里的 Claude Code 就开始工作:合并文档、发布博客、git push——出门在外也能让 AI 代劳。TypeScript + SQLite + 微信 iLink 官方 API,零封号风险。 - [SuperPaymaster 部署运营指南:从 Sepolia 到主网的完整操作手册](https://blog.mushroom.cv/blog/superpaymaster-v5-3-3-beta-launch-operations-guide/): SuperPaymaster v5.3.3-beta 引入了 UUPS 升级脚本、幂等部署工具链和三维度 audit-core 验证框架。本文是社区 Operator 和开发团队的完整部署参考:合约地址表、deploy-core 流程、Sepolia vs 主网差异、以及主网部署 Checklist。 - [一句话生成能上线的 Lottie 动效:这个开源 Skill 讲清了 AI 能解什么](https://blog.mushroom.cv/blog/text-to-lottie-ai-agent-skill-guide/): diffusionstudio/lottie 是一个让 Claude Code、Codex 等 AI Agent 一句话生成可直接上线 Lottie 动效的开源 Skill。本文读透 README 后写成:安装方法、工作流、高质量 prompt 策略、3大技术陷阱,以及——为什么 Lottie 恰好是 AI「能解」的创意领域。 - [57k Star 的代码解析神器:Understand Anything 完整实用指南](https://blog.mushroom.cv/blog/understand-anything-codebase-knowledge-graph/): Understand Anything 把任意代码库变成可交互的知识图谱,支持 Claude Code、Cursor、Gemini CLI 等全平台。本文是彻底读懂 README 后写出的实战指南:安装、工作流、5大核心场景、踩坑提醒,一篇搞定。 - [AnimaWorks 深度指南:开源 Python 智能体框架,五层记忆体系让 AI 真正「记住」你](https://blog.mushroom.cv/blog/animaworks-open-source-agent-memory-framework-guide/): xuiltul/animaworks 是一款开源 Python 框架,用脑科学启发的五层记忆架构(情节/语义/程序/工作/人际)替代上下文窗口截断,让 AI 智能体能跨会话学习、自动遗忘低效知识、在组织层级中协作。本文拆解其记忆体系、完整安装流程和开发者实战指南。 - [CareerForge:一行命令搞定 AI 求职全流程,从搜岗到拿 Offer 的完整指南](https://blog.mushroom.cv/blog/careerforge-ai-job-search-skill-guide/): 开源 AI 求职工具包 CareerForge(GitHub 61 星)提供 6 个串联 Skill:搜岗位、匹配简历、生成简历、写求职信、模拟面试、Offer 决策。一次安装,自然语言触发,帮普通求职者把投递效率提升 3-5 倍。 - [哪吒:7MB 的 Agent-First 桌面 IDE,彻底解决 AI 编程的注意力碎片化问题](https://blog.mushroom.cv/blog/nezha-agent-first-ide-ai-coding-guide/): 哪吒(Nezha)是专为 AI 并行编程打造的桌面应用,GitHub 1.4k 星,7MB 安装包。把多项目管理、任务追踪、终端、代码浏览、会话回放、Git 工作流整合到一个界面,告别在 5 个工具间反复切换。本文是普通开发者的完整使用指南。 - [25MB 跑 SOTA:KittenTTS 极致轻量 + Spark TTS 中文零样本克隆,两条路径完全指南](https://blog.mushroom.cv/blog/kittentts-spark-tts-edge-ai-chinese-tts-complete-guide/): KittenTTS 14.1k star,15M 参数 int8 量化 25MB,纯 CPU ONNX 推理,树莓派和浏览器可跑——但不支持中文。Spark TTS 0.5B 参数,Qwen2.5 LLM 骨干,中文 CER 仅 1.20,零样本声音克隆,本文给出两个项目的完整使用路径和场景选型指南。 - [OpenBiliClaw:把推荐系统的逻辑反过来——你来决定看什么](https://blog.mushroom.cv/blog/openbiliclaw-open-source-bilibili-recommendation-system-reversal/): B 站的推荐是黑箱,每天替你决定能看到什么。OpenBiliClaw 是一个本地运行的开源 AI Agent,用五层心理画像跨平台主动帮你找内容,647 star,数据 100% 留在你自己的硬盘。 - [PR-Agent:把代码审查交给 AI,11.4k star 的开源 PR 评审工具完全指南](https://blog.mushroom.cv/blog/pr-agent-qodo-ai-code-review-complete-guide/): qodo-ai/pr-agent 深度调研:/review、/describe、/improve 七条斜杠命令全拆解,三条部署路径(GitHub Actions / Docker 自托管 / Qodo Cloud),支持 OpenAI、Claude、Gemini、DeepSeek 等全系列大模型,以及如何用 .pr_agent.toml 精确控制评审行为。 - [Video Expert Analyzer 完全指南:Walter Murch 六法则 + Mac MLX 本地模型全路径](https://blog.mushroom.cv/blog/video-expert-analyzer-mac-mlx-local-model-complete-guide/): ALBEDO-TABAI/Video-expert-analyzer 深度调研:从场景检测到五维 AI 评分,完整讲透工具架构、云端 API 和 Mac 本地 MLX 模型(oMLX / Rapid-MLX + Qwen-VL / Gemma 4)两条路径的部署全过程。 - [从0到1构建AI Agent:六步实战指南](https://blog.mushroom.cv/blog/building-ai-agent-six-step-framework/): 一线工程师六周落地AI Agent的系统化方法论:任务定义、SOP设计、MVP验证、工具集成、测试迭代、部署监控。 - [MiniCPM-o 实测:面壁智能小钢炮,端侧全双工 Omni 模型选型指南](https://blog.mushroom.cv/blog/minicpmo-omni-model-developer-guide-selection/): 亲测 MiniCPM-o 4.5 全双工视频通话接近产品级,9B 参数在 A100 上延迟仅 0.5 秒。本文提供开发者集成指南、移动 SDK 说明,并横向对比 GPT-4o Realtime、Gemini Live、Qwen2.5-Omni、Moshi,帮助小团队做好 Omni 模型选型。 - [MiniMind-O:113M 参数的全模态模型,能做 Agent 的眼睛、耳朵和嘴巴吗?](https://blog.mushroom.cv/blog/minimind-o-multimodal-agent-eyes-ears-voice/): MiniMind-O 是一个 113M 参数的全模态小模型,支持图像输入、语音输入输出和文本,单卡 RTX 3090 可训练,CPU 可推理。本文从 README 提取核心能力,评估它能否作为移动端 Agent 的感知层(眼睛+耳朵+嘴巴),以及配合 MCP/大模型做分层 Agent 架构的可行性。 - [M1 Max 64GB 本地AI完整方案:Qwen3选型、内存管理与多模型调度](https://blog.mushroom.cv/blog/m1-max-64gb-local-ai-model-selection-memory-guide/): 持续更新:M1 Max 64GB MacBook 本地AI最佳组合方案。涵盖 Apple Intelligence 3B 复用、Qwen3-30B-A3B/27B/32B 全8bit部署、oMLX多模型调度、48GB可用内存边界测算与系统精简。 - [我们给发布流程加了一个 SEO/GEO 优化步骤——让 AI 引擎也能找到你的文章](https://blog.mushroom.cv/blog/seo-geo-skill-ai-citation-optimization/): GEO(生成式引擎优化)是 2024 年以来最重要的内容分发变革:文章能否被 ChatGPT、Perplexity、Claude 引用,和传统 SEO 规则完全不同。本文记录我们如何把 GEO 能力内置到发布流程,以及核心的 10 个优化动作。 - [CyberClip / 眼镜蛇:外挂式智能眼镜模块的 Idea 阶段](https://blog.mushroom.cv/blog/cyberclip-ai-glasses-module-idea/): 一个外挂式、零算力、即插即用的 AI 视觉与听觉传感器模块,让任何普通眼镜秒变 AI 眼镜。Cable 直连手机获得 AI 能力,无需蓝牙 WiFi,成本控制在 ¥100-150 以内。想法阶段,欢迎社区参与讨论和共建。 - [在本地跑 DeepSeek V4-Flash:硬件选型与部署手册](https://blog.mushroom.cv/blog/deepseek-v4-flash-local-inference-guide/): DeepSeek V4-Flash 284B MoE 模型本地推理完全指南:为什么「13B 激活参数」不等于 13B 内存需求,四档硬件方案对比,以及 Mac M4 Ultra、多卡 GPU、vLLM 的实操步骤。 - [GEO 实战手册:SEO 之后,如何让 AI 帮你说话?](https://blog.mushroom.cv/blog/geo-generative-engine-optimization-guide/): 生成式引擎优化(GEO)完整指南:从 KDD 2024 学术论文到本博客的实战执行记录——robots.txt AI爬虫配置、BlogPosting JSON-LD、各 AI 引擎引用逻辑对比,以及用 Claude Code 自动化 GEO 审计的完整流程。 - [继续等Mac Studio还是投入AMD怀抱Or云GPU?](https://blog.mushroom.cv/blog/mac-studio-vs-amd-vs-cloud-gpu-local-ai/): 2026年本地AI推理硬件选购完全指南:Mac Mini M4 Pro、Mac Studio M4 Max / M3 Ultra、AMD Minisforum MS-S1 MAX、云GPU(AutoDL/RunPod)四路横评,TTS/ASR/ImageGen/VideoGen/TxtGen/VibeCoding六大场景HuggingFace Top-3模型推荐与成本对比。 - [科研笔记示例:深度学习模型优化方法](https://blog.mushroom.cv/blog/research-note-example/): 记录最近在模型训练过程中的一些优化技巧 ## Research - [Yandex 开源 AliceAI-Foundation-80B-A3B 基座模型:Apache-2.0 属实,俄语强,中文分词比 Qwen 多耗 58%](https://blog.mushroom.cv/blog/yandex-aliceai-foundation-80b-a3b-base-moe-teardown/): AliceAI-Foundation-80B-A3B-Base 是 Yandex 从零训练的 80B 总参、约 3B 激活的 MoE 基座模型,Apache-2.0(LICENSE 文件已核实),上下文 262,144。骨架几乎照搬 Qwen3-Next-80B-A3B,换成 Kimi Delta Attention、注意力残差和 sigmoid 路由;benchmark 全部自跑,20 行里 12 行是 Yandex 自建的俄语测试。本机实测它的分词器:同一批纯中文段落比 Qwen3-Next 多用 58% 的 token,GB2312 一级 3755 个常用字只有 726 个是单独 token。官方 bf16 权重约 162.6GB,社区 4-bit 约 45GB、混合 2/4-bit 约 28GiB,Mac 至少 48GB 起步,且要用第三方补丁代码。 - [云舒 SkillsHub 对比 claude-skill-registry:38 个手作 Skill vs 16 万条爬来的 SKILL.md,该用哪个?](https://blog.mushroom.cv/blog/yunshu-skillshub-vs-claude-skill-registry-comparison/): yunshu_skillshub 是 760 星、单人手作的 38 个 Claude Code Skill,有一条真实跑通的产品交付链路;claude-skill-registry 号称收录 16 万+ SKILL.md,但抽查发现相当一部分是项目内部专用脚本、空描述甚至受限许可。两者根本不是同类产品:一个是可以直接用的方法论,一个是待你自己筛选的搜索引擎。 - [LLM Wiki 的知识更新问题,Tencent 用 Agent Memory 这样解——TencentDB-Agent-Memory 拆解](https://blog.mushroom.cv/blog/tencentdb-agent-memory-llm-wiki-knowledge-update-team-memory-hub/): TencentCloud/TencentDB-Agent-Memory,26.9K stars,TypeScript,团队级 Agent 记忆中枢。在 Karpathy LLM Wiki 模式上加了三件事:异步持续摄取解决知识失效、四种记忆资产(Chat Memory/Skill/LLM-Wiki/CodeGraph)解决单一知识库局限、per-agent 绑定+ACL 解决团队共享权限。PersonaMem 留存率从 48% 升至 76%。 - [Neural Imprint:让部署中的 AI 模型真正从经验中学习,而不是每次从零开始](https://blog.mushroom.cv/blog/neural-imprint-atomgradient-continual-learning-device-ai/): 质子梯度(AtomGradient)发布 Neural Imprint 白皮书 v2(2026-09-17),提出让已部署 AI 在持续使用中积累经验、更新模型状态,无需重新训练。三个 Gen-1 组件:RPP(激活空间用户建模)、DSR(稀疏注意力缓存管理)、FrogJump(层跳过加速)。实测:90B 模型在手机上跑 200 轮对话峰值 5.5GB,语音合成中位延迟 32.28ms。CC BY-NC-ND 4.0。 - [高性价比人生指南:498 条循证建议,每条写明成本、收益和证据等级,优化四种资源](https://blog.mushroom.cv/blog/howtolive-better-evidence-based-chinese-life-guide-498-tips/): eternity4719/HowToLiveBetter,Unlicense,在线检索页已开,498 条按性价比排序的中文生活建议,涵盖长寿、急救、省钱、法律红线、恋爱婚育、程序员红线、创业、看病等 31 章。每条注明花什么(钱/时间/精力)、换什么(总死亡率/金钱/人身自由)、证据等级(A/B/C)和原始文献来源(891 条链接)。A 级 323 条,极高性价比 88 条,2366 stars。 - [后训练自动化:AIBuildAI 用元搜索在 PostTrainBench 拿第一,46.6 分超过所有 Agent](https://blog.mushroom.cv/blog/aibuildai-llm-posttrain-agent-autonomous-meta-search-posttrainbench/): AIBuildAI LLM-Post-Train Agent,Apache 2.0 开源,7 stars,Python。核心是「元搜索」:元 Agent 读取任务后自己写搜索程序,而不是走固定拓扑。四个知识库(104 种后训练方法、215 个数据集、108 个框架、34 张工作流卡)通过 MCP 接口查询。在 PostTrainBench 七个任务+四个基座模型上得分 46.6,超过 Locus(45.6)、Claude Code Fable 5(41.8),只有官方 instruct 模型(51.1)在前面。 - [CMU 11-768 AI Agents:OpenHands 作者亲授,从零搭 Harness、建评测、用 RL 训 Agent,视频讲义全开放](https://blog.mushroom.cv/blog/cmu-11-768-ai-agents-fall-2026-neubig-openhands-harness-rl-course/): CMU 语言技术研究所秋季新课,Graham Neubig(OpenHands 核心创始人)+ Daniel Fried 主讲。28 节课三阶段:搭 ReAct Harness→建 LLM-as-judge 评测→SFT+RL 训练 Agent。YouTube 播放列表已上传前 4 讲,3 次作业 starter code 已开放,GitHub 组织 cmu-agents。官网 cmu-agents.com。 - [MIT MAS.S60 多模态 AI:Paul Liang 主讲,15 周从融合对齐到推理智能体,YouTube 全集公开](https://blog.mushroom.cv/blog/mit-mas-s60-6s985-multimodal-ai-spring-2026-open-lectures-paul-liang/): MIT Media Lab + EECS 双授课号(MAS.S60 / 6.S985),Paul Liang 主讲,Spring 2026。15 周系统覆盖多模态融合、对齐、大模型、生成、推理、交互、智能体到自进化 AI。各讲 YouTube 视频逐一公开,官方课程页提供日程和材料,GitHub 组织 MIT-MI 托管代码与前序课程资料。 - [Stanford CS146S:《现代软件开发者》,MCP/Claude Code/Warp 十周实战,讲义全开放](https://blog.mushroom.cv/blog/stanford-cs146s-modern-software-developer-ai-coding-agent-mcp-course/): 斯坦福 2025 秋季本科课程,Mihail Eric 主讲,3 学分,10 周覆盖 LLM 提示工程、Coding Agent 构建、MCP 服务器开发、Claude Code、Warp 终端、AI 安全(SAST/DAST/提示注入)、AI 代码审查、全栈 AI 部署、SRE 可观测性。43 份讲义 PDF 和文章全部开放,每周配作业,Boris Cherny、Zach Lloyd、Martin Casado 等工业界嘉宾亲授。 - [Stanford CS329A:《自我改进 AI Agent》,斯坦福研究生研讨课,9 集视频全公开](https://blog.mushroom.cv/blog/stanford-cs329a-self-improving-ai-agents-course-open-materials/): 斯坦福 2025 秋季研究生研讨课,Azalia Mirhoseini 和 Aakanksha Chowdhery 联合授课。核心论点:推理时算力制造下一个模型的训练数据。覆盖 Constitutional AI、STaR、DAPO、Search-o1、ReAct、MemGPT 等自我改进技术。9 集视频 2026 年 8 月全公开,GitHub 作业仓库开源。 - [人类造的最后一个 AI:递归自我改进的五个自主等级与 HCI 能力轨迹指标](https://blog.mushroom.cv/blog/last-ai-built-by-humans-recursive-self-improvement-hci/): 33 位作者联合提出 HCI(Headroom-Closed Index)和五级递归自我改进框架:数学能力 HCI 86.4,工具 Agent 从 8.2 跳升至 39.9,L5 级 AI 将自主修改控制自身改进过程的机制。arXiv 2609.11873,CC BY-NC-ND 4.0。 - [多智能体到底什么时候有用?Google、DeepMind、MIT 做了 260 个配置来回答这个问题](https://blog.mushroom.cv/blog/scaling-agent-systems-science-google-deepmind-mit/): 三大机构联合研究:多智能体的效果不取决于模型多先进,而取决于任务结构是否适合分工。可分解任务提升 +80.8%,顺序规划任务下降 -70.0%,能力饱和效应解释了为什么「更多 Agent」有时反而更差。 - [a16z 合伙人 80 分钟 AI 深谈:护城河是被发现的,最大机会是让人更快乐](https://blog.mushroom.cv/blog/a16z-anish-acharya-ai-loops-moats-consumer/): Anish Acharya 在 Lenny 播客中提出了四个反直觉洞察:公司正在变成Loop、模型选择是门手艺、消费者真正需要的不是效率而是快乐、护城河从来不是设计出来的。这不是预测,是当下正在发生的重组逻辑。 - [Anthropic 算了一笔账:如果 AI 真的跑到最快,美国经济会变成什么样](https://blog.mushroom.cv/blog/anthropic-ai-economic-scenarios-us-2030/): Anthropic 发布三情景经济模型:温和情景 GDP +1.6%,实质情景 GDP +8.3%、增速超过90年代互联网泡沫,极端情景 GDP +32.4%、认知失业率 17.9%。这不是预测,而是一张算法:给定 AI 进化速度,经济会走向哪个分叉。 - [NeoHorse-1:第一个认真搭递归自我改进原型的开源小模型](https://blog.mushroom.cv/blog/neohorse-1-recursive-self-improvement-agentic-post-training/): TokenRhythm 用 Routing Harness 让 4B/9B 模型自己观察执行轨迹、估算能力缺口、把反馈注回训练混合——十项基准平均 +5.93 vs Qwen3.5-4B。这不只是一次后训练,是一个闭环的雏形。 - [Anthropic 威胁情报报告(2026年9月):AI 把攻防成本倒置了](https://blog.mushroom.cv/blog/anthropic-threat-intelligence-report-september-2026/): Anthropic 公开记录 2025.12-2026.8 间 Claude 被滥用的七大类真实案例:俄罗斯间谍、ShinyHunters 供应链攻击、中国高校漏洞研究、多大洲选举干预……关键结论:AI 正在压平国家级行为者与个人攻击者之间的能力鸿沟。 - [ECCV 2026 最佳论文拆解:热核纹理 HKTex 让 3D 模型不用再展 UV,李飞飞团队感知损失获时间检验奖](https://blog.mushroom.cv/blog/eccv-2026-best-paper-heat-kernel-textures-uv-free/): ECCV 2026 最佳论文颁给帝国理工的 HKTex:用约 4.8k 个贴在网格表面的各向异性热核取代 UV 贴图,313 个 Objaverse 模型上平均 96.6KB、LPIPS 优于所有对比方法,代码 MIT 开源但只支持 Linux + NVIDIA。时间检验奖授予 2016 年的感知损失、SSD 和 Learning without Forgetting。我们在 Mac 上复现了它的数学底座并指出三个落地障碍。 - [果蝇大脑被网友塞进《我的世界》和驾校:16.6 万神经元的连接组,离「上传意识」还差多远?](https://blog.mushroom.cv/blog/malecns-fruit-fly-connectome-games-minecraft-driving/): 9 月 3 日公开的雄性果蝇全中枢神经连接组 MaleCNS v1.0(约 16.67 万神经元、1.25 亿个突触)一周内被网友接进《我的世界》、节奏光剑和 CARLA 驾驶模拟器。我们逐个核实一手源:Flyhard 用 165,122 个神经元训练出转方向盘技能(留出测试 0/100→100/100,花 0.67 美元),但速度和转向指令仍是脚本;NeuroCraft 的动作由人写好的程序执行,打乱权重后部分反应依然存在;节奏光剑那段是在复现录好的动作。连接组是线路图,不是大脑,更不是意识。 - [Qwen3.8-Flash-Next 要多大内存的 Mac?拆开 Unsloth GGUF:最小的「1-bit」档也有 72.5GB,其中 28.8GB 可以放在 SSD 上](https://blog.mushroom.cv/blog/qwen3-8-flash-next-gguf-mac-unified-memory-quant-guide/): unsloth/Qwen3.8-Flash-Next-GGUF 是 Qwen4 架构预览版(125B 总参、6B 激活,外加 51B n-gram 嵌入)的 GGUF 量化,110 万次下载。我们逐个读了 10 个量化档的 GGUF 张量头:所谓 1-bit 只压了专家的 gate/up 投影,28.8GB 的 n-gram 表至少是 4-bit,所以最小档仍有 72.5GB。好在主线 llama.cpp 默认按需从磁盘读这张表,常驻内存可以比文件小 28.8GB。结论:16/24/32GB 的 Mac 别想了,64GB 处在灰色地带,128GB 的 Mac 推荐 UD-Q4_K_XL。 - [YC 2026 十大创业主赛道:从卖软件到直接干活,范式已经切换了](https://blog.mushroom.cv/blog/yc-2026-ten-startup-tracks-ai-native-services/): YC 2026 点名十大创业方向:AI-Native服务公司、公司大脑、SaaS杀手、Software for Agents、AI个性化医疗……最核心的信号是:这一代创业公司不卖工具了,直接把活儿干了。 - [27B 模型压到 11.8GB 还「任务无损」:奥地利 IST 用两篇论文的方法重做了 GGUF 量化](https://blog.mushroom.cv/blog/gsq-rco-non-uniform-gguf-quantization/): 均匀量化对所有张量一视同仁,GSQ-RCO 不是——它用梯度搜索按每个张量的敏感度分配精度,在总大小预算内做非均匀分配。结果:Qwen3.8-27B 从 53.8GB 压到 11.8GB(4.6 倍),AIME25 和 LiveCodeBench 分数与 BF16 原模型完全一致。文件是标准 GGUF,llama.cpp、Ollama、LM Studio 直接跑。 - [把 RL 训练的每个角色都做成独立服务:OpenBMB 开源 Meshy,同步与全异步只差一个参数](https://blog.mushroom.cv/blog/meshy-openbmb-async-rl-training-framework/): Meshy 是 OpenBMB 开源的异步 RL 训练框架,也是训练 MiniCPM5 的引擎。它把推理、训练、rollout 各自做成独立进程,全部通过一个 TransferQueue 数据平面通信,控制流由数据就绪度驱动,没有中心 driver 分发 RPC。最有意思的设计:同步、有界离策略、全异步三种训练模式共用同一套服务,差别只在 rollout 的节奏窗口这一个参数。 - [LEANN:省掉 97% 向量存储,让 RAG 跑在本地设备上](https://blog.mushroom.cv/blog/leann-rag-97-percent-storage-savings-graph-recompute/): Berkeley 出品的 MLsys2026 最佳论文,用图结构+按需重计算替代全量向量存储,6GB 索引 6000 万文本块(传统方案需 201GB),支持 PDF/邮件/微信/浏览器历史/Claude 对话等全个人数据,零遥测本地运行,Stars 12913。 - [LLM-as-a-Verifier:无需训练的通用 Agent 验证框架,三域 SOTA](https://blog.mushroom.cv/blog/llm-as-a-verifier-general-framework/): 开源通用 Agent 验证框架,用 logprob 细粒度打分替代二元判断,概率轴心锦标赛算法将复杂度从 O(N²) 降至 O(Nk),在编程、机器人、医疗三个 benchmark 上达到 SOTA,无需额外训练,Stars 3151。 - [MiniCPM5 + Meshy:OpenBMB 的端侧 LLM 与异步 RL 训练框架双开](https://blog.mushroom.cv/blog/minicpm5-meshy-ondevice-rl-framework/): OpenBMB 同步发布 MiniCPM5 系列端侧模型(1B/2B 双 SOTA)与 Meshy 异步 RL 引擎。RL+OPD 训练使推理提升 10.96 分,标准 LlamaForCausalLM 架构直接兼容主流推理框架,Meshy 用队列替代 RPC 实现拓扑灵活的分布式 RL。 - [消融不是越彻底越好:Qwen3.8-27B-OBLITERATED 三代手术的取舍曲线](https://blog.mushroom.cv/blog/qwen38-27b-obliterated-v3-abliteration-blending-mmlu-tradeoff/): 同一个 Qwen3.8-27B 底座的另一条消融路线,96.9 万下载、1093 likes,Apache-2.0。真正值得看的是它把 V1/V2/V3 三代方法和代价全公开了:V1 单次激进 SVD,MMLU 掉 6.0pp;V2 把 SVD 和 LEACE 两种手术按 60/40 混合互相抵消弱点,只掉 0.28pp,但软性安全说教还在;V3 用迭代堆叠加定向语料把软回避也清了,代价回升到 2.12pp。也就是说 V2 和 V3 不是升级关系,是曲线上两个不同的取舍点。能力损失还不均匀——STEM 掉 3.3pp,哲学反而涨 6pp。 - [斯坦福 CS329Z:AI Agent 工程正式进入大学课程,拆解全部 22 讲内容](https://blog.mushroom.cv/blog/stanford-cs329z-ai-agent-engineering-course-curriculum-analysis/): 斯坦福 2026 年秋季新增 CS329Z《AI Agent 工程》课程,由 Diyi Yang、Michael Ryan 和 John Yang 主讲。本文完整拆解 11 周 22 讲的课程结构、必读论文清单和两份作业,分析它对 Agent 工程师的实用价值。 - [Commerce Agents 技术深潜:购物车提升 30%、完成率提升 60% 背后的六个架构决策](https://blog.mushroom.cv/blog/anthropic-commerce-agents-30pct-cart-technical-architecture-deep-dive/): Anthropic commerce-agents 正式开源,合作伙伴实测购物车规模最高提升 30-35%,购买完成率提高约 60%。本文深入拆解六个关键技术决策:单 Agent + Skills、UI 组件工具调用、提示词缓存命中率 90-99%、harness 层安全强制、异步记忆提取,以及 Shopify UCP 集成路径。 - [Reef:自进化 Agent 的开源工程基础设施,把「用户交互」变成下一轮学习数据](https://blog.mushroom.cv/blog/reef-self-evolving-agent-open-source-infrastructure-human-agent-society/): MIT、NUS 等机构的 Human-Agent-Society 团队开源 Reef。它的核心判断:真实用户交互可以成为下一轮学习数据。Reef 提供四环学习闭环(Serve→Observe→Grow→Commit),支持模型权重和 Agent Harness 两类更新对象,SkillClaw 配方无需 GPU 即可运行。 - [Clipto 融资 1500 万美元:本地 AI 记忆成赛道,开源订阅能不能打?](https://blog.mushroom.cv/blog/clipto-local-memory-ai-content-management-15m-funding-analysis/): AI 内容管理公司 Clipto 完成 1500 万美元融资,估值 2.5 亿美元。产品核心是「Local Memory」——视频、图片、会议、文档全在本地用自然语言搜索,不上传云端。本文拆解其产品架构、商业模式、用户画像,并分析开源+订阅路线在这个赛道的可行性。 - [Raskar 的创意六边形:六条路径,系统性产生新想法](https://blog.mushroom.cv/blog/raskar-idea-hexagon-systematic-ideation-six-paths/): MIT Media Lab 教授 Ramesh Raskar 提出「创意六边形」——从任意已知概念 X 出发,通过六条固定路径系统性地产生新想法:维度泛化、异类融合、锤子找钉子、钉子找锤子、加形容词、做反面。本文展开分析框架,并给出可操作的思考工具。 - [VibeGame:用自然语言描述,8个 Agent 协作,直接生成可玩的完整 2D 游戏](https://blog.mushroom.cv/blog/vibegame-prompt-to-game-ai-native-engine-adversarial-agent-team/): 南京大学 + 南洋理工大学联合发布 VibeGame,一个 AI-native 游戏引擎 + 对抗性 Agent 团队框架,能从自然语言 prompt 和参考图片直接生成并持续编辑完整的 2D 网页游戏,支持 IP 迁移、类型迁移和规则重构。 - [Lemmalog:把 Agent 记忆做成一个能演绎推理的数据库,而不是「记得更准的向量库」](https://blog.mushroom.cv/blog/lemmalog-datalog-engine-llm-agent-memory/): JordyZomer/lemmalog 开源仅一周:Rust 实现的 Datalog 引擎给 LLM agent 当长期记忆,LLM 只断言事实,闭包/时序/矛盾检测全由规则演绎。LongMemEval、MemEval、LoCoMo 三个标准基准实测,LoCoMo 排 10 个系统第 2,token 省 6-400 倍。MIT,带 Claude Code MCP server。 - [4DAnyone:用一段普通竖屏视频,重建任何人的 4D 模型](https://blog.mushroom.cv/blog/4danyone-monocular-video-4d-gaussian-splatting-multi-view/): ant-research/4DAnyone ⭐1051,蚂蚁研究院 SIGGRAPH Asia 2026 成果,从单目竖屏视频生成多视角视频,实现 4D Gaussian Splatting 重建,支持 6/24/48 视角全轨道相机,峰值显存 25.4 GiB,Apache 2.0。 - [Skill Evolution:从 Warp 案例提炼「技能进化」通用范式](https://blog.mushroom.cv/blog/skill-evolution-warp-self-improving-agent-feedback-loop/): Warp 用两个 skill 文件构建了自我改进的 Agent 闭环——内层 skill 承载领域知识,外层 improver skill 定期拉取人类反馈并提议最小化改动。本文从这个案例提炼出可复用的「技能进化」通用范式,以及如何从零搭建这套机制。 - [VibeVoice:微软开源的前沿语音 AI 家族,ASR 一次跑60分钟,CPU 也能实时推理](https://blog.mushroom.cv/blog/vibevoice-microsoft-frontier-voice-ai-asr-tts-streaming-bitnet-cpu/): microsoft/VibeVoice ⭐53474,开源前沿语音 AI 模型家族,ASR 单次处理60分钟音频输出「谁/什么时候/说了什么」,Realtime-0.5B 流式 TTS 首字延迟300ms,ASR-BitNet 无需GPU三线程实时推理,MIT 许可。 - [WikiSkill:Google Research 提出把 Agent 经验编译成永久知识,Skill 进化终于有了「记忆」](https://blog.mushroom.cv/blog/wikiskill-agent-experience-persistent-wiki-skill-evolution/): Google Research 最新论文(arXiv:2608.27454)提出 WikiSkill:在原始经验与可执行 Skill 之间插入持久化 Wiki 层,经验永不丢失、知识复利积累。横跨 5 个基准、5 个模型,一致超越 EvoSkill/SkillOpt/Trace2Skill,并详解工程落地方案。 - [YC Summer 2026 全批次分析:236 家公司,AI Agent 与 Physical AI 双线爆发](https://blog.mushroom.cv/blog/yc-summer-2026-batch-analysis-236-companies-ai-agents-robotics-wordcloud/): 抓取 YC S26 全部 236 家公司数据,分析标签、行业、关键词分布,生成词云。AI Agent(22%)和 Physical AI/Robotics(25%)成为最显著的两条主线,74% 团队不超过 3 人,旧金山占 74%。 - [Anthropic MHS:AI 正式接管物理世界——开源硬件的下一个机会在哪里](https://blog.mushroom.cv/blog/anthropic-mhs-model-hardware-standard-ai-agents-physical-devices-open-hardware/): Anthropic 发布模型硬件标准(MHS)研究预览,统一 AI Agent 操控实体设备的接口层,已接入 Genentech/CMU/QuEra/LeRobot/树莓派。分析开源硬件接入 MHS 的工程路径与优先项目。 - [Belief Context Graph:把 Agent 记忆从「检索」升级为「置信度感知的信念图」](https://blog.mushroom.cv/blog/belief-context-graph-bcg-agent-memory-confidence-provenance-deterministic-reasoning/): bigai-nlco/belief-context-graph 开源,BCG 用可审计的置信度、证据溯源、冲突检测把 Agent 记忆升级为信念图,解决长程推理中「该不该相信这个事实」的核心问题,MIT 许可,⭐59。 - [Needle 2:14MB、45M 参数、跑在手机里的工具调用基础模型——Simple Attention Network 架构解析](https://blog.mushroom.cv/blog/needle2-cactus-compute-45m-tool-calling-tiny-device-foundation-model/): Needle 2(GitHub: cactus-compute/needle,⭐9,593,Apache-2.0)是 Cactus Compute 发布的 45M 参数端侧基础模型,14MB 单文件二进制,28MB RAM 内完整运行,专为工具调用、设备控制、结构化提取设计。基于 Simple Attention Network(arXiv:2607.18363):Hadamard MLP + GQA 注意力 + engram 键值记忆 + CQ2-bit 量化。在同类小模型横测中以 5-70倍更小的体积与 FunctionGemma 270M、Apple FM 互有胜负。 - [Semantica:AI 界的开源 Palantir,用知识图谱解决企业 AI 最难的问题——决策溯源](https://blog.mushroom.cv/blog/semantica-graph-native-ai-provenance-enterprise-knowledge-graph/): Semantica(GitHub: semantica-agi/semantica,⭐11,136,MIT,v0.6.7)是一套图原生 AI 基础设施:把企业多源数据自动构建成知识图谱,每一个 AI 决策都作为图节点记录下来,带完整因果链和 W3C PROV-O 溯源,支持 Neo4j/AWS Neptune/RDF 等多种图数据库,原生集成 MCP/Claude Code/CrewAI/Agno,pip 一行安装。核心价值:让 AI 决策可解释、可审计、可追问。 - [框架工程(Harness Engineering):用确定性执行层替代提示词工程——arXiv:2608.26197 实验全解析](https://blog.mushroom.cv/blog/harness-engineering-llm-agent-deterministic-structured-planning/): arXiv:2608.26197「Harness Engineering for Predictable Agentic Systems」是一篇9页实证研究,作者 Saransh Dhage(独立研究者,非谷歌)用两个模型×两个任务×100次重复跑出了一个反直觉结论:在 LLM Agent 外面套确定性执行层,不一定能提升可复现性——甚至可能变差。真正有效的关键只有一个:结构化规划(Structured Planning)。本文完整拆解实验设计、五个 Harness 组件、两阶段结果、成本数据,以及对 Agent 工程实践的真实启示。 - [Harvey AI 的 Moneyball 路线:中小AI公司如何训练垂直域模型——从评测基准、开源基座到异步RL的完整案例](https://blog.mushroom.cv/blog/harvey-ai-vertical-llm-training-moneyball-legal-ai/): Harvey AI 以法律为切入点,开创了一条「先建评测、后选基座、再做RL」的垂直域模型训练路线。本文以 Harvey Tenet(基于 Kimi K3 + Fireworks 异步RL)、Review Table(GLM-5.2 + Applied Compute)、M&A Diligence(RLM + Baseten)为案例,完整拆解其成本、数据、供应商、评测、训练的全链条决策,同时收录开源仓库 harveyai/harvey-labs(LegalAgentBench,1266 ⭐,1671任务,24+实践领域),供正在寻找垂直域训练路线的团队参考。 - [CUA-Lite:UC Berkeley + Microsoft 开源计算机操控 Agent 基础设施,无需 KVM,Docker 直跑 OSWorld,4.6× 并行](https://blog.mushroom.cv/blog/cua-lite-kvm-free-osworld-docker-computer-use-agent-berkeley-microsoft/): CUA-Lite 是来自 UC Berkeley 和 Microsoft 的开源框架,将计算机操控 Agent(CUA)的训练和评测基础设施标准化。核心创新:用 Docker 容器替换 QEMU/KVM 虚拟机运行 OSWorld——内存从 4.1GB 降至 0.9GB,并行实例数提升 4.6 倍,冷启动从 29.9s 降至 23.8s,评测分数不变。统一 action/observation 空间覆盖桌面、浏览器、移动端;一键 Eval + SFT + RL;10+ 数据集 + 30k+ 可验证任务。 - [Block3D:浙大 ZIP Lab 开源文本生成 3D,分块扩散实现 5.15× 加速](https://blog.mushroom.cv/blog/block3d-zhejiang-text-to-3d-block-wise-diffusion-efficient/): 浙江大学 ZIP Lab 联合莫纳什大学开源 Block3D——一个分块扩散框架,将离散形状 token 序列按块分组,块间自回归保证因果结构,块内所有 token 并行去噪,并引入置信度引导的块内修正机制。与微调自回归基线相比,端到端生成时间从 25.71 秒降至 4.99 秒(5.15 倍加速),几何保真度不降。论文:arXiv 2608.19567。 - [红杉的终局判断:AI 应用公司的终点是每家都变成 Neo-Lab](https://blog.mushroom.cv/blog/neo-lab-sovereign-ai-endgame-sequoia-every-company/): 红杉美国合伙人 Sonya Huang 在一场创始人闭门分享中提出两个核心判断:主权 AI(Sovereign AI)才是下一代护城河,以及所有认真做事的 AI 应用公司最终都会演变为某种形态的 Neo-Lab。本文提炼这场分享的全部核心论断——从「套壳时代」的终结,到主权 AI 四层自主权的拆解,到 Neo-Lab vs 传统实验室的本质差异,到创始人最易踩的三个误区,再到可直接执行的四条落地路径。 - [FDE 实战手册:大企业 vs 中小企业,前三个月该怎么干](https://blog.mushroom.cv/blog/applied-compute-specific-intelligence-enterprise-ai-workflow-training/): 基于全网 20+ 篇一手资料,拆解 FDE(Forward Deployed Engineer,AI 落地工程师)在大企业和中小企业的前三个月打法差异:大企业重治理、审计、跨部门对齐;中小企业重速度、直接交付、快速量化。附核心技能栈、衡量指标、工具清单与原始参考链接。 - [三足鼎立:读 Codex Harness、DeepSeek Harness 与 AgentScope 2.0 的横评](https://blog.mushroom.cv/blog/deepseek-harness-everything-plugin-cordis-compare-claude-code-codex/): 读后感:社媒横评三款开源 Agent 运行时底座——Codex Harness(OpenAI,Apache-2.0,80+ Rust 子模块)、DeepSeek Harness(MIT,Cordis 微内核,一切皆插件)、AgentScope 2.0(阿里,企业全家桶,国内私有化首选)。原文核心论点:你 Demo 跑得好但生产炸锅,缺的不是更聪明的模型,是 Harness。加上我们的补充分析:三强定位差异、LangGraph 的残余价值、以及国内团队的选型建议。 - [FDE 怎么炼成:审计先行 + 30 天拆流程,读「一页 Digest」的方法论笔记](https://blog.mushroom.cv/blog/fde-30day-audit-workflow-enterprise-ai-deployment-playbook/): 读后感:「一页 Digest」关于 FDE(AI 落地工程师)实操方法论的社媒帖——三步工作法(先懂业务→再定 AI 边界→最后搭系统)、审计作为真正第一步(价值是成本的 10 倍)、以及从零练起的 30 天计划。写给想入这个行当但不知从何下手的人。 - [读「$200/月 AI 干掉后勤部」:模式可行,但有三个洞他没填](https://blog.mushroom.cv/blog/ai-native-company-200-dollar-logistics-local-privacy-qwen3-analysis/): 读后感:小红书博主健康长寿的DanDanDan转述 CodeWall 创始人的 AI 原生公司实践——$200/月订阅替代 CRM、数据室、会议工具和 EA 人力。核心流程拆解后,我们补充了三个原文未涉及的方向:隐私分层架构(公有云 API 换本地 Qwen3-8B)、本地部署真实成本(已有 M 系 Mac 的情况下接近零)、「公司大脑」通用产品化路径(Docker 一键启动 + 开源核心 + 托管云版)。 - [读后感:从飞猪帮帮看懂「模型+Harness+记忆」——附一套可落地的 AI 应用架构建议](https://blog.mushroom.cv/blog/fliggy-bangbang-model-harness-memory-agent-architecture/): 读小红书博主小盖《做AI PM的朋友,可以看看这个产品的反思》后的分析与延伸。小盖复盘了飞猪从「问一问」到「飞猪帮帮」的AI化路径,提出所有Agent产品最终收敛到「模型+Harness+记忆」这套架构,并分享了后训练自有模型、Multi-Agent精简为单Agent、三层记忆分工、LUI驱动GUI而非取代GUI等具体判断。本文核实了飞猪帮帮的真实产品信息,把这套架构和「Agent=Model+Harness」的行业共识做交叉验证,并结合本站近期调研的多个开源Agent项目,给出一套分阶段的AI应用落地架构建议——包括个人/小团队的简化替代路径。 - [以太坊放弃 Poseidon 读后感:一次反向适配,如何给后量子路线抢回两年](https://blog.mushroom.cv/blog/ethereum-post-quantum-roadmap-poseidon-exit-hash-friendly-snark/): 读 Foresight News《八年投入急转弯,以太坊为何突然放弃 Poseidon?》后的分析。真正的转折不是换了个哈希函数,而是适配方向反转——从「SNARK 友好型哈希」变成「哈希友好型 SNARK」。本文拆解这次转向对以太坊后量子路线的六条具体加速作用,并系统梳理 PQ 路线的完整组件图:leanXMSS、leanVM、3SF、PQ 密钥注册表、EIP-8141,以及 I*→J*→L*→M* 的里程碑序列和到 2029 年的时间表。 - [5块钱让大模型学会看图做几何题:GRPO 后训练的低成本实验](https://blog.mushroom.cv/blog/agentic-rl-lab-grpo-vision-post-training-low-cost-geometry/): KMnO4-zx/agentic-rl-lab,147 stars,Apache 2.0,Python。用 PyTRIO 远程训练平台 + GRPO 算法,5元在 Qwen3.5-4B 上做几何图形问答(GeoQA)的 Vision RL 后训练,准确率从 71% 升到 87%(+16pp)。全系列复现了 10 篇 RL 算法论文(GRPO/DAPO/GSPO/Search-R1/ReTool 等),核心主题:只写数据、reward 和 loss——把 infra 交给远端,让 RL 后训练的门槛从「一台 8 卡机器」降到「一行命令」。 - [OpenRSI:让「AI 改进 AI」变成可执行、可测量的工程问题](https://blog.mushroom.cv/blog/openrsi-frontis-ma1-recursive-self-improvement-ai4ai-mle/): FrontisAI/OpenRSI,arXiv:2607.28568,CC BY-NC 4.0,Python。把递归自改进(RSI)从哲学概念变成工程实验的开源全栈系统。核心:以机器学习工程(MLE)为首个可执行领域,训练 Frontis-MA1(35B)作为元演化 Agent,用四个原子算子(Draft/Improve/Debug/Crossover)统一后训练和推理。MLE-Bench Lite 上,单张 RTX 4090,Medal Average 从 39.39% 升到 71.21%,超过 GPT-5.5 + Codex(68.18%),逼近 GPT-5.6 Sol 和 2.8T 的 Kimi K3。模型权重、Gym、训练、搜索、评估全部开源。 - [Agentic Harness Engineering:用可观测性让 Coding Agent 自动进化自己的运行时](https://blog.mushroom.cv/blog/agentic-harness-engineering-observability-self-evolution-coding-agent/): 复旦+北大+奇迹智风,arXiv:2604.25850,MIT,Python。AHE 提出一个闭环:不动模型权重,只进化 harness——通过三层可观测性(组件/经验/决策),让 Evolve Agent 自动分析 trace、提出修改、预测效果,下一轮自动验证。10次迭代把 GPT-5.4 在 Terminal-Bench 2 上从 69.7% 提升到 77.0%,超过手写 Codex-CLI(71.9%)。冻结后的 harness 迁移到 SWE-bench-Verified,在三个其他模型族获得 +5.1~+10.1pp 跨模型增益。 - [Agent Plugins 规范深度解析:一次构建,Codex / ChatGPT / Cursor / Copilot / VS Code / Kiro 全通](https://blog.mushroom.cv/blog/agent-plugins-openai-codex-multi-client-open-spec-analysis/): OpenAI 联合 AWS、Cursor、GitHub、Microsoft、Vercel 发布 Agent Plugins 规范:Skills + Connectors + MCP 三层架构,180 个官方插件已在 marketplace,一份 plugin.json 对接六大客户端。本文深度拆解规范结构,并分析这个开放标准在未来 Agent 分发战争中打开的真实机会窗口。 - [4B 小模型 RL 微调追平 GPT-5.6,成本百分之一:Castform 的技术框架与领域迁移预测](https://blog.mushroom.cv/blog/castform-neon-small-model-rl-finetuning-domain-specialist/): Castform + Neon 的博客证明了一件事:4B 开源模型经过 RL 后训练,在金融检索任务上跑赢了 GPT-5.2,成本降低 100 倍。这篇文章深度拆解这套框架的三个核心组件(任务/环境/奖励函数)和合成数据管道,并分析将同样机制迁移到营销文案、邮件写作、社媒回帖、舆情分析等领域的可行性与卡点。 - [MAGI-2 Preview 深度解析:114B MoE 视频生成,激活参数仅 6B,完整自部署指南](https://blog.mushroom.cv/blog/magi-2-preview-sand-ai-114b-moe-video-generation-analysis/): Sand.ai 开源 MAGI-2 Preview:全球首个千亿级 MoE 视频生成模型,114B 总参数,单 token 激活仅 6B,统一音视频生成,Apache 2.0。文章深度拆解 MagiMoE 架构、数据管道哲学与成本逻辑,并给出完整自部署方案:硬件选型、权重下载、环境搭建、推理命令、成本估算全覆盖。 - [Swan AI 拆解:3 个人、0 个 COO、20+ 个 AI 员工——B2B GTM 的「AI 工程师」模式](https://blog.mushroom.cv/blog/swan-ai-gtm-engineer-b2b-sales-agent-analysis/): Swan AI 是一个 AI GTM Engineer 平台,让 B2B 公司的销售/市场团队用自然语言描述需求,AI 自动跑完从线索发现到成交的全流程。三个创始人:CEO 用 LinkedIn 0 投放撬出单月 30 万美金 ARR,CTO 不写一行代码用 AI 扛下 15 人工程团队,Ido 负责「生产」20+ 个 AI 员工。这家公司最有价值的地方,是它本身就是自己产品的最佳证明。 - [五家公司冲到 1 亿 ARR,打法完全不同:AI-Native GTM 手册读后,真正变了的只有三件事](https://blog.mushroom.cv/blog/ai-native-gtm-playbook-three-things-actually-changed/): 读 ON_Discourse 的 AI-Native GTM 三部曲:Hugging Face、Clay、Writer、Legora、Sierra 五家公司冲到 1 亿 ARR 的路径毫无共同点。作者总结了九个模式,但我认为其中六个是 SaaS 旧道理换了新词——真正因为 AI 而改变的只有三件事:品类命名从营销动作变成采购前提、商业模式必须和产品同时出生、你的第一个读者不再是人。 - [Threads 调研:5 亿用户、超越 X 移动端、全球投广——Meta 第二个十亿入口的三年行动](https://blog.mushroom.cv/blog/threads-meta-500m-users-x-competitor-research-2026/): 基于 TechCrunch、The Verge 等海外媒体的系统调研:Threads 三年从 0 到 5 亿月活,2026 年 1 月日活移动端超越 X(141.5M vs 125M),全球投广、AI 入 DM、社区 + 实时直播聊天、亲子监控——覆盖增长轨迹、功能时间线、变现策略、与 X 竞争格局、以及向 10 亿用户的路径。 - [拆解一个「已落地」的智能客服 Agent 项目:概念体系、逻辑链路与工程落地判断](https://blog.mushroom.cv/blog/agent-customer-service-architecture-teardown-review/): 读一篇公众号里已脱敏的智能客服 Agent 项目拆解:从概念体系梳理、逻辑流程串联,到工程落地判断——如果用 n8n 搭建这套循环该怎么设计节点、做成 Agent 该接什么模型、怎么把这套架构落地成真正可用的智能客服产品。 - [构建实时数据流项目的最佳起点:Awesome Public Real-Time Datasets 完整导读](https://blog.mushroom.cv/blog/awesome-public-real-time-datasets-streaming-api-bytewax/): bytewax/awesome-public-real-time-datasets 是一个 2751 stars 的公开实时数据源合集,覆盖金融加密货币、交通、气象、网络安全、IoT、体育等类别,大量免费 WebSocket/SSE/REST 接口。本文按使用场景整理关键数据源,适合构建流处理管道、AI 训练数据集和实时 Agent 工具的开发者。 - [Kimi AgentENV:驱动 Kimi K3 RL 训练的 Firecracker 沙箱基础设施深度拆解](https://blog.mushroom.cv/blog/kimi-agentenv-firecracker-sandbox-rl-training-infrastructure-kimi-k3/): kvcache-ai 开源的 AgentENV(AENV)是 Kimi K3 Agentic RL 训练的底层沙箱平台,基于 Firecracker microVM + overlaybd + ublk,实现 50ms 启动/恢复、100ms 快照和运行时 Fork,并提供 E2B 兼容 API。MIT 开源,Rust 实现,可自托管替代 E2B。 - [Kimi K3 技术深析:KDA、Stable LatentMoE 与首个开源 3T 级模型](https://blog.mushroom.cv/blog/kimi-k3-technical-analysis-architecture-training-open-frontier/): Kimi K3 是全球首个开源 2.8T 参数模型,同步发布权重与技术报告。本文结合 GitHub 通讯仓库与 HuggingFace 权重仓库,深析 Kimi Delta Attention(KDA)、Stable LatentMoE(16/896 专家)、MXFP4 量化感知训练等核心架构创新,以及 AgentENV 训练基础设施的技术联系。 - [模型可以小,脚手架要聪明——CMU 论文拆解:用 Harness 适配让 SLM 以 4% 成本追平 LLM](https://blog.mushroom.cv/blog/cmu-better-harnesses-smaller-models-slm-agent-cost-reduction-engineering/): 卡内基梅隆大学最新论文(arXiv:2607.08938)证明:对于重复性业务任务,小模型(3B~30B active params)配合针对性适配的 harness,可以用 4% 的成本恢复 89.7% 的 LLM 性能。本文深度分析论文框架,提炼 5 条工程上可直接落地的操作指南。 - [Macaron-V1-Venti:Mixture-of-LoRA + GLM-5.2,个人智能体 + Generative UI 的新范式](https://blog.mushroom.cv/blog/macaron-v1-venti-mixture-of-lora-glm52-personal-agent-genui/): MindLab Research 发布的 Macaron-V1-Venti 是一个 748B 参数的开源旗舰模型:744B 的 GLM-5.2 基础模型加上四个 1B 的 LoRA 专家,通过 L0 路由实现 Chat/Agent/Coding/GenUI 的任务分发。本文深度拆解 MoL 架构、LongStraw 百万 token RL 训练基础设施、MindForge 递归自我改进循环,以及 MIT 授权的开放权重。 - [934MB 适配器,27B 基座,95% 代码通过率——BTL-3 的 LoRA 炼成路](https://blog.mushroom.cv/blog/btl-3-lora-adapter-qwen-programming-agent-tool-calling-training/): BTL-3 用 rank-32 LoRA 在 Qwen3.6-27B 上做强化学习后训练,用不到 1GB 的适配器权重,在编程智能体和结构化工具调用上打出 88.5% BFCL / 95% HumanEval 的成绩。本文深入 adapter_config.json 和训练设计,拆解 LoRA 怎么让一个 27B 模型变成专职 Agent。 - [HarnessX:脚手架即进化对象——9B 模型 ALFWorld 从 53% 飙到 97% 的秘密](https://blog.mushroom.cv/blog/harnessx-agent-scaffold-evolvable-darwin-team-xiaomi-engineering-guide/): 小米 Darwin Agent 团队提出 HarnessX,将 Agent 脚手架(prompt、工具、记忆、控制流)作为可进化对象,用执行轨迹驱动自动迭代。5 个 benchmark 平均提升 14.5pp,9B 模型 ALFWorld 从 53%→97%,不换模型、不加数据。本文深度解析 HarnessX 的核心思路和工程落地方法。 - [别浪费失败!斯坦福用「失败轨迹」让 GUI Agent 无需训练提升 15%(ECCV 2026)](https://blog.mushroom.cv/blog/learning-from-failure-inference-time-gui-agent-improvement-stanford/): 斯坦福 ECCV 2026 论文:把 AI Agent 执行失败的轨迹喂给 Claude 4.5 做诊断,自动生成「代码补丁」注入推理过程。OSWorld 基准 42.3%→48.9%(+15.6% 相对提升),零训练成本,仅增加 8% 推理开销,步数反降 15%。四大失败模式逐一击破:定位错误、能力缺口、知识不足、死循环。 - [NOVA:腾讯广告如何用 Agent Harness 让推荐模型架构自动进化(13x 提速,GMV +2%)](https://blog.mushroom.cv/blog/nova-verification-aware-agent-harness-recommender-tencent-architecture-evolution/): 腾讯广告推荐系统团队的 NOVA:用「架构梯度」替代人工直觉驱动推荐模型架构进化,四级验证级联阻截 silent failure,L3 任务 EPR 60%,Literature-to-Production 周期缩短 13x,线上 GMV 提升 +1.25%~+2.02%,pCVR bias 降低 37%~67%。 - [Startup 冷启动增长手册:按 MRR 阶段逐个打透渠道的完整框架](https://blog.mushroom.cv/blog/startup-cold-start-channel-sequencing-zero-to-arr-growth-playbook/): 没有神奇渠道,只有「在正确阶段用正确渠道,打透后再叠加下一个」。本文从多个真实案例抽象出通用的冷启动增长框架:5个阶段 × 核心渠道 × 切换信号 × 操作清单,结合 Sequoia PMF 框架与增长率底层逻辑,帮你在每个阶段做正确的事。 - [脑子的数据量:从果蝇 20TB 到人脑 1.4PB,我们到底在测量什么](https://blog.mushroom.cv/blog/brain-connectome-data-size-fly-human-mouse/): 网上流传「1 毫克脑组织=20TB 信息量」的说法,其实混合了三项不同的连接组研究:果蝇中央脑(2020,20TB+ 原始扫描数据)、人脑颞叶皮层 1 立方毫米(2024,1.4PB)、小鼠视觉皮层 1 立方毫米(2025 MICrONS,1.6PB)。这些 PB 级数字是电镜扫描和三维重建产生的图像数据量,并不等于大脑真正的记忆容量——两者差了好几个数量级,也回答不了同一个问题。 - [Redbubble 深度调研:2006年开始的艺术家按需印刷帝国,65万艺术家、A$2.9亿营收,AI时代面临最大挑战](https://blog.mushroom.cv/blog/redbubble-print-on-demand-artist-marketplace-business-model-analysis/): Redbubble 成立于2006年墨尔本,是全球最大的独立艺术家 Print-on-Demand 市场。FY2023:A$290.7M 营收,500万活跃用户,65万艺术家,480万设计。ASX上市,旗下还有 TeePublic。本文深度梳理其商业模式、艺术家收入机制、平台挑战及AI时代的存亡问题。 - [Strategy Gene:AI 经验可以成为流通资产——前提是用对表示形式(论文解析 + 工程落地指南)](https://blog.mushroom.cv/blog/strategy-gene-gep-experience-reuse-llm-agent-test-time-evolution/): arXiv:2604.15097,清华大学+EvoMap。核心判断:经验表示形式本身是一阶因素——文档式Skill(2500 tokens)让性能-1.1pp,紧凑Gene(230 tokens)让性能+3.0pp。介绍Gene结构、GEP协议三层架构,以及skill2gep/evolver开源实现和工程落地方法。 - [19000 星开源书:《深入理解 AI Agent》,10 章 92 个实验,从上下文工程到多 Agent 协作全覆盖](https://blog.mushroom.cv/blog/ai-agent-book-context-engineering-llm-agent-open-source-chinese/): 李博杰著《深入理解 AI Agent:设计原理与工程实践》,bojieli/ai-agent-book,19005 stars,Apache-2.0。围绕「Agent = LLM + 上下文 + 工具」展开,10章92个配套实验(70+可独立运行),7种语言,全部免费开源,PDF/EPUB 可直接下载。 - [Google YouTube 自进化推荐系统:LLM Agent 替代 ML 工程师,双环架构工程落地指南](https://blog.mushroom.cv/blog/google-self-evolving-recommendation-system-youtube-llm-agent/): arXiv:2602.10226,RecSys 2026,Google YouTube 团队。LLM(Gemini 2.5)驱动双环 Agent 架构,自主发现优化器、神经架构和奖励函数改进,优于64%人工 launches。本文深度解析论文架构,并给出可落地的工程实现指南。 - [57.5%:互联网的主角换了,只是大多数人还没发现](https://blog.mushroom.cv/blog/machine-web-paradigm-57-percent-machines-internet-shift/): Cloudflare CEO Matthew Prince 2026年6月推文:全球HTML页面HTTP请求里,机器人占57.5%,人类只剩42.5%。这不是流量波动,是互联网三十年来第一次主角替换。梳理数据背后的结构、逻辑与每个人必须面对的现实。 - [SenseNova-Vision:一个7B模型做完所有CV任务,需要什么硬件?](https://blog.mushroom.cv/blog/sensenova-vision-unified-cv-hardware-guide/): SenseNova-Vision-7B-MoT 把目标检测、深度估计、分割、3D重建等所有CV任务统一成一个生成模型。Web Demo跑起来需要1张80GB显卡,完整benchmark需要8张80GB,训练至少2台8×80GB机器。详细硬件配置指南。 - [LongStraw:在固定 GPU 预算下,把 RL 训练推到 200 万 token](https://blog.mushroom.cv/blog/longstraw-million-token-rl-training-gpu/): 推理已经支持百万 token,但 RL 后训练卡在 256K 以下。LongStraw 用驻留状态 + 响应回放 + 分布式原生执行三项技术,在 8 张 H20 上完成 2M token 的精确 GRPO 训练。arXiv 2607.14952,已开源。 - [Stan Store 深度分析:创作者变现平台的集成支付逻辑、核心缺陷与下一代方向](https://blog.mushroom.cv/blog/stan-store-creator-monetization-platform-analysis/): Stan Store 是目前创作者快速变现赛道里最好的入口工具。本文从产品逻辑、支付集成、竞品格局、8 个核心缺陷出发,提出 6 个下一代改进方向,给出战略判断。 - [Anthropic 的 AI 创业手册:四个阶段、十二个陷阱、如何用它自检你的 idea](https://blog.mushroom.cv/blog/anthropic-founders-playbook-ai-startup-methodology/): Claude 团队公开的《Founder's Playbook》把 AI 原生创业从想法到规模化拆成 Idea / MVP / Launch / Scale 四阶段,每个阶段有明确的退出条件和常见陷阱。本文拆解核心观点,并给出一套自检清单:用这套方法论判断你的 idea 是否值得赌上时间。 - [按头安利:AudarAI —— 阿拉伯语 ASR 排行榜第一,还顺手做了个打赢 GPT-4o 的 TTS](https://blog.mushroom.cv/blog/audar-asr-tts-arabic-first-speech-ai/): AudarAI 同时开源了两个阿拉伯语语音 AI:Audar-ASR-V1(Whisper 编码器 + Qwen3 解码器,登顶 36 系统的开放阿拉伯语 ASR 排行榜)和 Audar-TTS-V1(零样本声音克隆 + 17 种情感标签,MSA 评测击败 GPT-4o-mini-TTS,海湾方言 WER 低于 ElevenLabs v3)。 - [Audio8-ASR-0.1B:0.1B 参数,LibriSpeech 2.70 WER,iPhone 本地跑只占 200MB](https://blog.mushroom.cv/blog/audio8-asr-01b-on-device-speech-recognition/): Audio8-ASR-0.1B 是一个端到端参数量 0.324B、语言模型核心仅 0.1B 的自回归 ASR 模型,LibriSpeech test-clean WER 2.70%,Open ASR Leaderboard 七集平均 WER 7.03%。三条部署路径:Transformers(Python 服务端)、ONNX Runtime(跨平台 HTTP API)、iOS ANE(iPhone 本地,峰值内存约 200MB)。支持中英法德日韩粤 7 语言,热词增强无需微调。 - [健身 App 的数据底座:exercises-dataset 1324 个动作数据集拆解与集成指南](https://blog.mushroom.cv/blog/exercises-dataset-fitness-app-data-layer/): exercises-dataset 是一个包含 1,324 个健身动作的开源数据集(14k+ ⭐),每个动作配有动画 GIF、180×180 缩略图、肌肉分组数据、9 种语言的分步说明。本文拆解数据结构,并给出从导入数据库到搭建 REST API 的完整集成路径,适合快速落地健身 App 的运动库功能。 - [训练 AI Agent 的数据配方:OpenThoughts-Agent 100+ 消融实验全拆解](https://blog.mushroom.cv/blog/openthoughts-agent-sft-data-recipe-agentic-models/): UC Berkeley、Stanford、Bespoke Labs 等多机构合作的 OpenThoughts-Agent 论文(arXiv:2606.24855)做了迄今最系统的 Agent SFT 数据配方研究:6 阶段流水线、100+ 消融实验、100K 数据集,微调 Qwen3-32B 达 7 基准均值 44.8%,超越 Nemotron 3.9pp。最有价值的不是模型权重,而是那套可复用的数据选取逻辑。 - [字节跳动开源 OpenViking:给 AI Agent 造一个「会自我进化的上下文数据库」](https://blog.mushroom.cv/blog/openviking-bytedance-context-database-for-ai-agents/): volcengine/OpenViking(2.6万⭐)不是又一个 RAG 框架,而是给 AI Agent 设计的上下文数据库——用文件系统范式统一管理记忆、知识库和技能,半年 2.6 万星,VLDB 2026 论文支撑。 - [网页爬虫的范式革命:PixelRAG 不读 HTML,它看截图](https://blog.mushroom.cv/blog/pixelrag-visual-web-crawler-screenshot-rag/): Berkeley SkyLab 开源的 PixelRAG(6.5k⭐)彻底改变网页检索方式——不解析 HTML,直接对网页截图做视觉嵌入,让表格、图表、信息图在 RAG 里第一次真正可检索。 - [Agent 通信协议的第一张地图:读完这篇论文,我知道未来不会是一个赢家通吃](https://blog.mushroom.cv/blog/llm-agent-protocol-taxonomy-federated-stack-2026/): arXiv:2606.19135 对 9 个活跃的开源 Agent 通信协议做了五维分类学研究,结论是:短期会有收敛压力,长期必然走向联邦式分层协议栈,就像 OSI 模型那样。 - [TMEM:给 Agent 装上「可学习的参数记忆」——阿里通义论文工程解析](https://blog.mushroom.cv/blog/tmem-parametric-memory-agent-guide/): 阿里巴巴通义 Qwen 团队提出 TMEM,让 Agent 在单次会话内通过 Fast LoRA 直接把经验写进模型参数,不再只是「查」历史——而是真正「学会」了。本文拆解论文原理,并给出工程落地的实现思路。 - [发布 7 天:Agents-A1 登上 HuggingFace 首页,社区版本超过 50 个](https://blog.mushroom.cv/blog/agents-a1-community-validation-huggingface-trending/): Agents-A1(上海AI实验室,35B MoE)发布一周后:7K 官方下载、18K 系列合集、60K+ 含社区变体总下载,登上 HuggingFace Trending 首页,MLX Community 上线 Mac 原生版,HLE 基准 <128B 模型 #2,IFStruct 基准 #1。一周社区反应完整记录。 - [Agent eval 的六代迭代:从看答案到看分布](https://blog.mushroom.cv/blog/brainstrust-agent-eval-six-generations-guide/): 转载整理自 BrainTrust 原文《The six generations of AI agents and how to eval them》:Agent 从 Prompt→Chain→ReAct Loop→Workflow Graph→Modern Agent Loop→AI Harness 六代演进,eval 对象也从最终答案扩展到 trace、分布、分层系统。核心:正确但太贵不算成功;Production-to-Eval 飞轮才是团队最长期的资产。 - [Agents-A1:35B 追平万亿参数,路走得更长,不是模型堆得更大](https://blog.mushroom.cv/blog/agents-a1-35b-moe-horizon-scaling-guide/): 上海人工智能实验室(InternLM 团队)发布 Agents-A1(arXiv:2606.30616):一个 35B MoE 模型,在长程 Agent 基准上与 Kimi-K2.6、DeepSeek-V4-pro、GPT-5.5 等万亿参数模型持平或超越。核心不是堆参数,而是把知识-行动轨迹拉到 45K tokens 平均长度(KAG 图 + 自博弈扩展),再用三阶段训练蒸馏六个领域专家进一个模型。SEAL-0 56.4、FrontierScience-Research 40.0(SOTA)。已开源 HuggingFace。 - [AOHP:让操作系统真正为 AI Agent 而生,清北港三校联合开源](https://blog.mushroom.cv/blog/aohp-android-agent-os-guide/): AOHP(Android Open Harness Project)是清华、北大、港大三校联合团队基于 AOSP 开发的开源 OS 级 Agent 基座(arXiv:2606.23449,Apache-2.0)。核心主张:把 Agent 提升为操作系统的第一类公民,而非让 Agent 在为人类设计的界面上笨拙操作。三大机制:个性化服务合成(用户定义的 App)、高效 Agent 接口(并行后台执行)、安全信息流(细粒度数据流追踪)。OpenClaw 基准:完成率 +21%,Token 消耗 -51%。 - [AutoMem:让 Agent 自动学会管理记忆,32B 追平 Claude Opus 4.5](https://blog.mushroom.cv/blog/automem-agent-memory-skill-training-framework-guide/): Stanford 团队(arXiv:2607.01224)提出 AutoMem 框架:把元记忆(metamemory)引入 LLM Agent,用两个循环自动优化记忆能力——外循环用强 LLM 审查轨迹修改 scaffold,内循环把 agent 自己的好记忆决策转成训练信号。只优化记忆不动任务动作,Qwen2.5-32B 在 Crafter/MiniHack/NetHack 上性能提升 2x-4x,追平 Claude Opus 4.5 和 Gemini 3.1 Pro Thinking。 - [Agentic AI 系统全景:用 Python 构建智能 Agent 的核心框架](https://blog.mushroom.cv/blog/agentic-ai-systems-python-comprehensive-guide/): Agentic AI 系统的核心概念全景:从 ReAct 循环到多 Agent 编排,从工具调用到记忆管理,从 LangChain/LangGraph 到 AutoGen/CrewAI,覆盖构建生产级 AI Agent 所需的架构模式、Python 实现和工程实践。面向希望系统性理解 Agentic AI 的开发者和建设者。 - [领域专用小模型:Manning 新书《Domain-Specific SLMs》完整阅读指南](https://blog.mushroom.cv/blog/domain-specific-small-language-models-manning-guide/): Guglielmo Iozzia 的《Domain-Specific Small Language Models》(Manning, 2026, 376 页)完整导读:15 章覆盖 FAISS 向量检索、ONNX 量化、ProtGPT2 蛋白质生成、vLLM 离线推理、Graph RAG、AutoThink 等核心技术。作者来自 Merck & Co.,专攻生物医药 AI。附学习路径建议。 - [如何真正做好研究:Anthropic 研究员 Vivek 的 7 条核心原则](https://blog.mushroom.cv/blog/how-to-be-good-at-research-vivek-guide/): Anthropic AI Safety Fellowship 研究员 Vivek 写了一篇爆款文章《How to be good at research》,500 万浏览、3 万书签。本文提炼其 7 条核心原则,并给出博士生和研究人员的具体落地建议:如何建立研究品味、如何避开主流陷阱、如何用 Claude Shannon 的方法缩小难题。 - [Ornith-1.0:DeepReinforce 发布的 SOTA Agentic 代码 LLM,工程师如何借鉴它训练自己的模型](https://blog.mushroom.cv/blog/ornith-1-0-agentic-code-llm-rl-training-guide/): Ornith-1.0 是 DeepReinforce 发布的 SOTA Agentic 代码生成模型,9B/35B/397B 规格,SWE-bench Verified 75.6(行业顶级),采用 MoE + GatedDeltaNet 混合架构,256K 上下文,强化学习训练,支持 256K Token 上下文和视觉能力。本文从工程角度解读其核心设计,并给出如何借鉴 RL 和微调技术训练自己代码模型的实践指南。 - [PAW:0.6B 跑出 32B 效果,用「编译」替代 API 调用的新范式](https://blog.mushroom.cv/blog/program-as-weights-paw-fuzzy-functions-guide/): Program-as-Weights(PAW)提出「模糊函数编程」新范式:用 4B 编译器将自然语言描述编译成 LoRA 适配器,再用冻结的 0.6B 解释器本地运行。0.6B 解释器 + PAW 程序在 FuzzyBench 上超过 Qwen3-32B,内存只用 1/50,MacBook M3 跑 30 tokens/s。HuggingFace 今日论文第一。 - [AReaL 2.0:让已部署的 Agent 持续自我进化的工程指南](https://blog.mushroom.cv/blog/areal-agent-self-evolution-developer-guide/): 蚂蚁集团、港科大、清华联合提出的下一代 Agentic RL 系统论文,核心问题:企业级 Agent 部署后就「冻结」了,没有系统基础设施支撑它从真实交互中持续学习。本文分析三大支柱(ATDP轨迹协议、数据代理、演进控制平面),并提供基于开源 AReaL 框架的开发者接入指南。 - [Wiki Memory:LangChain CEO 预言的 Agent 记忆新范式,开发者深度解读](https://blog.mushroom.cv/blog/langchain-wiki-memory-developer-analysis/): Harrison Chase(LangChain CEO)在最新文章中提出 Wiki Memory 作为 AI Agent 长期记忆的新兴标准模式——不是 RAG,不是对话历史,而是让 Agent 把原始数据压缩成可维护的知识库文件。本文深度解读这篇文章的核心观点,并给出开发者实践指南。 - [Agent 进化为什么要用贝叶斯?Bayesian-Agent 把「技能」当成假设来检验](https://blog.mushroom.cv/blog/bayesian-agent-posterior-skill-evolution/): DataArcTech 开源 Bayesian-Agent:把 Agent 的每个技能当作「冻结模型会不会成功」的假设,维护后验分布,再映射成 patch/split/compress/retire/explore 五个动作。SOP-Bench 80%→100%、RealFin-Bench 增量修复只花基线 10-25% 的 token。本文拆解它,并梳理 Agent 自进化这条路线。 - [别再手搓 Agent 脚手架了:Stanford Meta-Harness 让 AI 自己搜索最优 harness](https://blog.mushroom.cv/blog/meta-harness-end-to-end-harness-optimization/): Stanford IRIS Lab 的 Meta-Harness(arXiv:2603.28052,Chelsea Finn、Omar Khattab 等)把决定「给模型存什么、取什么、喂什么」的 harness 代码本身变成可自动优化的对象:用一个能读源码、分数和执行轨迹的 agentic proposer 做外层搜索。文本分类 +7.7 分且省 75% token,IMO 级数学 +4.7 分,TerminalBench-2 上自动发现的 harness 超过手工基线。 - [32B 小模型逼近 GPT-5.2:S1-DeepResearch 如何用数据而非参数训练长程研究 Agent](https://blog.mushroom.cv/blog/s1-deepresearch-long-horizon-research-agent/): ScienceOne 开源 S1-DeepResearch-32B,能连续调用工具 150+ 轮、跨 20 个基准逼近 GPT-5.2/Claude-4.6/GLM-5,却只用 SFT、不用 RL。它的秘密是一套图谱驱动的轨迹构造范式:知识图谱出题、Agent 跑轨迹、五维验证过滤。本文拆解方法、跑分,并梳理业界对深度研究 Agent 的反思。 - [Alchemy AgentPay 深度拆解:当 AI Agent 开始花钱,支付基础设施战争打响了](https://blog.mushroom.cv/blog/alchemy-agentpay-ai-agent-commerce-protocol-analysis/): Alchemy 推出 AgentPay 开放测试版——一个协议无关的 AI Agent 支付代理层,同时支持 x402、ACP、MPP、A2P 四大主流协议。Morgan Stanley 预测 2030 年 AI 代理商务规模将达 3850 亿美元。这篇文章从 AI、Agent、账户三个维度深度拆解 AgentPay 的技术架构、产品定位和行业信号。 - [Agent 如何递归地学会学习:AgentOptimizer 与 ProRL 的完整技术栈](https://blog.mushroom.cv/blog/agent-recursive-self-learning-agentoptimizer-prorl/): NVIDIA Research 张少坤在智源大会分享两篇论文:AgentOptimizer 把函数当可学习权重、ProRL Agent 把 Rollout 变成服务——两者合起来是一个让 LLM Agent 从自身经验中递归自我提升的完整技术栈。GPU 利用率从 42% 升至 78%,SWE-Bench 8B 模型提升 88%。 - [Macaron AI 的开源版图:用 LoRA-RL 让 Personal Agent 真正「持续学习」](https://blog.mushroom.cv/blog/macaron-ai-mind-lab-lora-rl-agent-ecosystem/): Macaron AI 旗下的 Mind Lab 开源了一整套围绕 LoRA-RL 持续学习的 Agent 基础设施——从万亿参数 RL 训练平台 MinT,到自我进化框架 MetaClaw,再到终身记忆系统 SimpleMem,构成了目前最完整的 Personal Agent 持续学习技术栈。GitHub 组织 aiming-lab,总 Star 超 22k。 - [YC 内部 AI 系统的真相:数据集中 → 工具注册表 → 技能自我进化](https://blog.mushroom.cv/blog/yc-internal-ai-data-tools-skills-playbook/): YC 内部 AI 系统从 20 个工具长到 350 个,核心不是模型,而是一条有顺序的路径:数据集中、工具注册表、技能自我改进循环。本文拆解这条路径,以及企业与个人各自的三步落地法。 - [70 万人看过的 Agentic Engineering 心得:Matt Van Horn 22 条实战技巧全解析](https://blog.mushroom.cv/blog/matt-van-horn-agentic-engineering-hacks-guide/): last30days(2.7 万星)作者 Matt Van Horn 在 X 发布《我所知道的所有 Agentic Engineering 技巧》,70 万次浏览。本文汇编他的完整方法论:从 /ce-plan 规划范式、语音驱动开发、并行会话管理到 Compound Engineering,帮助 AI 工程师从 Vibe Coding 进化为真正的 Agentic Engineering。 - [Lethal Trifecta:Simon Willison 的 AI Agent 安全三角,《经济学人》都引用了这个术语](https://blog.mushroom.cv/blog/simon-willison-lethal-trifecta-ai-agent-security/): Django 联合创始人 Simon Willison 在 2025 年 6 月提出「致命三要素」思维模型:AI Agent 同时满足接触不可信内容、能访问私有数据、可以对外通信,安全风险进入高危区间。本文深度分析原始文章、真实攻击案例(GitHub MCP、Supabase MCP、微软 365 Copilot)和有效防御路径。 - [SkillOpt:微软联合上交复旦同济,让 AI Agent 的 Skill 像神经网络一样被训练](https://blog.mushroom.cv/blog/skillopt-microsoft-self-evolving-agent-skills-optimization/): 微软研究院联合上海交通大学、复旦大学、同济大学发布 SkillOpt——首个对 AI Agent Skill 文档进行系统化优化的框架,在 52 个评测单元全部获胜,让普通开发者无需训练模型就能持续提升 Agent 能力。 - [SkillPyramid:给 Agent 搭技能树,比 ReAct 多 38% 奖励少 28% 步骤](https://blog.mushroom.cv/blog/skillpyramid-hierarchical-skill-consolidation-self-evolving-agents/): 中科院自动化所、国科大、上海人工智能实验室和北京智源研究院联合提出 SkillPyramid:将 Agent 的任务经验整理成三层技能金字塔(原子 → 功能 → 抽象),在 ALFWorld/WebShop/ScienceWorld 上平均奖励提升 38%,交互步骤减少 27.7%。 - [GEPA:让 LLM 阅读自己的执行轨迹进化 Prompt,比 GRPO 少用 35x rollout 却赢 20%](https://blog.mushroom.cv/blog/gepa-reflective-prompt-evolution-vs-reinforcement-learning/): 来自 UC Berkeley、Stanford、MIT、Databricks 的 ICLR 2026 口头报告论文:GEPA 让 LLM 通过阅读自己的执行轨迹,自动反思、进化并合并 prompt 经验,在 HotpotQA 等任务上比 GRPO 平均高 10%,比 MIPROv2 高 12%,同时只需不到 3% 的 rollout 数量。 - [把 414 万份菜谱压进向量空间,人类烹饪知识自己长出了结构](https://blog.mushroom.cv/blog/epicure-food-ingredient-embedding-geometry/): arXiv 论文 Epicure 把 414 万份多语言菜谱和风味化学信息编码进同一个向量空间,在没有菜系标签的情况下,embedding 自然分出东亚、南亚、地中海等烹饪区域,还能恢复 27 个感官/营养方向。 - [SuperPaymaster:用链上资产抽象替代中心化签名服务,ERC-4337 Gas 代付去中心化的新路径](https://blog.mushroom.cv/blog/superpaymaster-aoa-gas-card-erc4337/): 来自 Mycelium 生态的 SuperPaymaster 论文发布在 arXiv。AOA 资产导向抽象用 Gas Card(灵魂绑定代币)替代中心化签名服务器,在 Optimism 主网实测中 L2 执行 Gas 比 Pimlico 低 49%,彻底移除了链下签名作为合法性关卡。 - [SkillFlow:用流匹配信号驱动 Agent 技能自主进化,14 个基准全面超越](https://blog.mushroom.cv/blog/skillflow-flow-driven-skill-evolution-agent/): 来自港中深、南大、南洋理工的研究:SkillFlow 用流匹配训练信号替代启发式 LLM 判断,让 Agent 自主管理技能库,平均提升 41.2% EM,计算成本降低 32-35%。 - [《Agent AI》:多模态交互与 AGI 路径综述](https://blog.mushroom.cv/blog/local-ai-agent-ai-book-review/): 李飞飞团队 2024 年综述论文《Agent AI》系统梳理 AI Agent 五大多模态 HCI 研究方向及其应用前景。 - [OpenAI 白皮书:如何治理 Agentic AI 系统](https://blog.mushroom.cv/blog/openai-governing-agentic-ai-systems/): OpenAI 2023年底发布的治理白皮书,系统阐述了 Agentic AI 系统的三方责任模型、最小权限原则和人类监督机制,为 AI 代理的安全部署提供了实践框架。 - [精准定阶:当前全域 Agent 生态 = 早期智人初创阶段](https://blog.mushroom.cv/blog/agent-ecosystem-early-homo-sapiens-stage/): 卡死边界、对标纯人类学硬特征——Agent 已完成个体质变,但群体沟通、集体协作、共识秩序、知识代际传承四大文明核心能力全处于稚嫩初创,严丝合缝锁定早期智人起步阶段。 - [从 Agent 课程谈起:Agent 是啥?](https://blog.mushroom.cv/blog/what-is-agent-skill-from-course-perspective/): 很多「Agent 开发」课程教出来的是工作流,不是 Agent。本文提炼 Skill 与 Agent 的核心定义:Skill 是能力原子(原生 Skill + 工具 Skill),Agent 的唯一标准是自主性——目标驱动、动态规划、感知反馈调整。附旅游 Agent 真伪对比、当前课程现象解析,以及 AI 时代 Agent 的四种未来形态。 - [比 Stripe 便宜 80%:稳定币正在系统性重写跨境支付的成本结构](https://blog.mushroom.cv/blog/crypto-stablecoin-cross-border-payment-systematic-analysis/): 跨境支付的综合费率高达 5.5%–6.6%,根源是 SWIFT 代理行模式的多层中介。本文系统分析 2025–2026 年加密支付的最新进展——稳定币交易额超 18 万亿美元、Solana 百毫秒最终性、Stripe USDC 集成、GENIUS/MiCA 双轨监管合规路径,以及加密旅游消费者 3 倍生命周期价值的实证数据,揭示从出入金摩擦到退单机制缺失的结构性阻碍,并绘制 2026 年后系统性融合的三阶段路径图。 - [软件公司转型:如何开发 Agent?一线团队的 8 步流程与 6 条避坑建议](https://blog.mushroom.cv/blog/how-to-build-agents-software-company-guide/): 业内公认的 agent 开发「教科书」只有两份:Anthropic 的 Building Effective Agents 和 OpenAI 的 Practical Guide。本文在此基础上还原头部团队(Sierra、Devin、Cursor)实际跑的 8 步流程,给出 agent 分类的两个正交维度,以及「eval-first」「工具设计 > prompt 工程」等 6 条经反复踩坑验证的具体建议。 - [软件层的退场与重构:AI-Native 时代,你的产品下一个用户是另一个 Agent](https://blog.mushroom.cv/blog/software-layer-ai-native-restructuring-laas/): 软件层不是在消失,而是被重构为 agent 的调度内核。本文提炼 Karpathy Software 3.0 框架、六级交互演进台阶、LAAS 本地 AI 架构边界、成果计费商业模式转轨,以及三条值得长期下注的方向——协议层公民、领域数据飞轮、意图设计与品牌信任。 - [AuraAI 阶段规划:Agent24 框架、小模型实验与 AgentSpeaker](https://blog.mushroom.cv/blog/auraai-phase-planning-agent24-small-model-experiment/): AuraAI 当前三条并行线:Agent24-Desktop(可插拔个人 AI 助手框架)正在积极推进;Mac 本地小模型实验给出了 64GB vs 128GB 的明确选型结论;AgentSpeaker(Nostr agent 通信协议)处于低优先级维护状态。 - [Agent 是什么?从意图到自主:封装了决策、规划和执行的智能体](https://blog.mushroom.cv/blog/what-is-agent-skill-autonomy-vs-workflow/): 市面上大多数'Agent 课程'教出来的,其实是预设好流程的工作流,不是真正的 Agent。本文深入剖析 Skill 与 Agent 的本质区别:自主性才是 Agent 的灵魂,而不是把 if-else 逻辑接上 LLM 调用。 - [普通组织的 AI-native 转型路线:6 步框架](https://blog.mushroom.cv/blog/ai-native-org-transformation-roadmap/): 借鉴 Anthropic 的 AI-native 组织实践,为普通企业提炼出可操作的 6 步转型路线:从价值链诊断、对齐机制重建、角色分工重构,到能力域定义、工具体系构建、交付节奏压缩。附带角色能力矩阵和工具选型框架,供直接套用。 - [AI Native 的三个层级:个人、组织与区域](https://blog.mushroom.cv/blog/ai-native-three-layers-skill-agent-organization-city/): AI Native 不是一个状态,而是一个过程。从个体用 Skill 获得新能力,到 Agent 完成任务级自主,再到组织的结构性变革,最终到区域/城市协作操作系统——每一层的跨越都比上一层复杂一个数量级。借鉴 Anthropic Cat Wu 的实践案例,结合 Mycelium Protocol 的视角,梳理这三层演进的逻辑。 - [TurboQuant 在 iDoris 上的可行性分析:能用它压缩本地 AI 的内存消耗吗?](https://blog.mushroom.cv/blog/turboquant-for-idoris--can-random-rotation-quantization-cut-/): Google Research 提出的 TurboQuant(ICLR 2026)声称用随机旋转 + 单一预计算 codebook 实现 6× KV cache 压缩。本文深度分析其在 iDoris 三层架构(Personal/Community/City)的落地路径:KV cache 压缩立即可用、RAG embedding 中期可用、训练时使用不可行。Mac Studio 64GB 上预计能腾出 30%+ 内存用于长上下文。 - [从线虫到人类:全脑模拟的规模化之路](https://blog.mushroom.cv/blog/brain-emulation-worm-to-human-scaling/): 前MIT研究员 Isaak Freeman 中止博士学业,发布百页路线图《From Worm to Human: Scaling Brain Emulation》,论证意识上传的技术可行性,以及在AGI时代人类通过数字化延续自身的可能路径。 - [auraai.mushroom.cv 上线:四大本地 AI 研究栏目,每周更新](https://blog.mushroom.cv/blog/auraai-local-ai-weekly-launch/): Aura AI Local AI 周报正式上线,硬件方案、模型匹配、软件工具、最佳实践四大研究栏目,附三年成本计算器,帮助每个人找到最优本地 AI 部署方案。 - [Aura AI 宣言:让每一个人平等拥有 AI](https://blog.mushroom.cv/blog/aura-ai-manifesto-153316/): AI 平权、Token Free、本地优先——我们不想让资本垄断的故事在 AI 领域重演。Aura AI 是 Mycelium Protocol 旗下的开源组织,致力于让每个人平等、低成本、安全地使用 AI。 - [社区:AI赋能的新型组织形式](https://blog.mushroom.cv/blog/community-ai-empowered-organization/): 当AI系统性地替代传统雇佣劳动,松散社区与极致个体将取代公司成为未来最重要的组织形态 - [意义经济崛起:资本意志和社会本能下的唯一路径](https://blog.mushroom.cv/blog/rise-meaning-economy-capital-social-instinct/): 随着大语言模型及通用人工智能的加速渗透,人类社会正面临一场史无前例的结构性断裂:生产力与生产资料的本质性脱钩。本文论证在资本意志加速去人化与社会本能被动自愈的双重挤压下,人类正被迫且必然走向以想象力、创造力与情感为内核的意义经济。 - [《2028年全球智能危机》:Citrini Research 的 AI 情景推演报告](https://blog.mushroom.cv/blog/2028-global-intelligence-crisis-report/): Citrini Research 发布的情景推演报告,构建了2026-2028年AI驱动的繁荣-崩塌闭环:从标普8000点到失业率10.2%,揭示无消费增长的悖论。 - [Block Inc. 裁员召回事件与《从层级到智能》深度研究](https://blog.mushroom.cv/blog/block-hierarchy-to-intelligence-report/): Jack Dorsey 领导的 Block Inc. 以AI驱动重组为由裁员约4000人,随后悄然召回部分员工。其联合红杉资本发布的《从层级到智能》论文引发广泛争议:究竟是真正的AI转型,还是借AI之名的洗白? - [Agent:从效率替代到组织变革](https://blog.mushroom.cv/blog/agent-from-efficiency-to-org-transformation/): Jack Dorsey 提出 AI 将替代传统层级管理,组织本质是 2000 年前的信息路由协议。本文结合中国古代伍长、保甲制度,分析 Agent 如何从根本上改变组织的信息聚合与决策链路。 - [Vitalik 的 AI 生存指南:本地模型是陷阱,三层防御才是出路](https://blog.mushroom.cv/blog/vitalik-ai-survival-guide-cn/): 以太坊创始人亲测:本地大模型连代码都写不好。真正的隐私需要 ZK-API、混合网络、TEE 三重防护,外加人机确认防火墙。 - [Vitalik's AI Survival Guide: Local Models Are a Trap, Three-Layer Defense Is the Way Out](https://blog.mushroom.cv/blog/vitalik-ai-survival-guide-en/): Ethereum founder's hands-on test: local LLMs can't even write decent code. Real privacy requires ZK-API, mixnets, TEEs, plus human-AI confirmation firewalls. - [AI Must Embrace Specialization: Why AGI Is the Wrong Goal](https://blog.mushroom.cv/blog/ai-must-embrace-specialization-en/): LeCun's latest paper challenges the AGI myth: human intelligence was never truly general. From Moravec's Paradox to the SAI framework, the future of AI lies not in mimicking humans but achieving superhuman performance in specialized domains. - [ARIS: 让 AI 在你睡觉时做科研](https://blog.mushroom.cv/blog/aris--auto-research-in-sleep-with-claude-code/): 一个基于双模型协作的自主 ML 科研系统,让 Claude Code 执行,GPT 审稿,实现全自动研究流水线 - [多模态大语言模型研究进展](https://blog.mushroom.cv/blog/bilingual-example/): 近期多模态大语言模型在视觉理解方面的突破性进展 - [Markdown Style Guide](https://blog.mushroom.cv/blog/markdown-style-guide/): Here is a sample of some basic Markdown syntax that can be used when writing Markdown content in Astro. - [Using MDX](https://blog.mushroom.cv/blog/using-mdx/): Lorem ipsum dolor sit amet - [Third post](https://blog.mushroom.cv/blog/third-post/): Lorem ipsum dolor sit amet - [Second post](https://blog.mushroom.cv/blog/second-post/): Lorem ipsum dolor sit amet ## Tech-News - [Hemmingway-1:一个「写得像人」的 27B 模型,能力靠自建榜单证明,还是 Qwen3.8 的一次精调?](https://blog.mushroom.cv/blog/hemmingway-1-27b-writing-model-benchmark-claims-teardown/): Hemmingway-1 是初创 Altworld 发布的 27B 文本模型,底子是 Qwen3.8-27B 的文本塔微调;权重约 54.7GB,两天内拿到 2745 次下载和 457 个赞。它宣称打赢多个前沿模型,但三项核心榜单全是自己出题自己跑;GitHub「Code」入口点开只有说明文档,没有一行训练或推理代码。 - [TypeSafe AI 的 Jev 生态刷屏:所谓「一天冒出 800+」,我们扒开一个索引仓库和 74 份「awesome」清单核实了一遍](https://blog.mushroom.cv/blog/jev-awesome-list-gold-rush-fact-check/): TypeSafe AI 的决策模型 Jev 9 月 15 日拿 4000 万美元种子轮早期发布,一周内 GitHub 上至少冒出 74 个「awesome-jev」索引仓库,其中一个今天创建的仓库 12 小时内把收录数从 148 冲到 805。我们通读它的 commit 历史、抽样核对 evidence 字段,发现这不是 805 个项目一天内被写出来,而是一个人聚合并核验了 32 份「兄弟名单」——最受欢迎的同类清单其实只敢标 640。 - [Bitterbot Desktop 拆解:2459 star 的「会做梦」AI Agent,记忆本地存但推理默认走云端](https://blog.mushroom.cv/blog/bitterbot-desktop-local-ai-agent-dream-engine-p2p-economy/): Bitterbot-AI/bitterbot-desktop 是 2459 star、MIT 协议的 TypeScript 项目:装在自己机器上的个人 AI,每 2 小时「做梦」整理记忆,把练成的技能通过 P2P 网络卖给其他 Agent 换 USDC。我们通读一手源发现:Mac Apple Silicon 有预编译 Rust 编排器二进制,装得上;但「local-first」指的是记忆存本地,默认推理仍是云端 Claude Opus 4.8;钱包和技能市场官方自称「实验性、未经审计」。 - [Agent Resilience 拆解:Cohesity 想给 AI 员工装 Time Machine,现在只护得住亚马逊 Bedrock](https://blog.mushroom.cv/blog/cohesity-agent-resilience-backup-restore-ai-agents/): 2026-09-16 Cohesity 发布 Agent Resilience,备份/恢复 AI Agent 的记忆、配置、权限和依赖拓扑;核实后发现目前只支持 AWS Bedrock、限定部分客户、年底才 GA,微软和谷歌仍在路线图。我们核实了两篇官方一手源,并对照本地部署场景给出现成能抄的开源思路。 - [AI 干活,持证会计师签字:从 Integral 的 1800 万欧元融资看专业服务的新架构](https://blog.mushroom.cv/blog/integral-maxed-oss-ai-native-professional-services/): 柏林公司 Integral 2026-09-16 宣布 1800 万欧元 A 轮,两年内累计融资超 3000 万欧元,用 AI 代理处理记账对账、专业人士审核例外并承担法律责任;同一天我们核实了报道里提到的开源项目 Maxed OSS,它是真实维护的 17 个仓库,把金额计算、对账、签名验证这类确定性工作做成 AI 可调用的工具。 - [HuggingFace 上的 Qwen-2.5-1B-RLCD:不是 1B、没有 RLCD、也没有模型权重](https://blog.mushroom.cv/blog/qwen-rlcd-huggingface-model-name-mismatch/): harshatheg/Qwen-2.5-1B-RLCD 挂在 HuggingFace 模型区、创建仅一天就有 221 赞、0 下载。我们通读了它的 README 和 MODEL_CARD:仓库里没有 RLCD(强化学习对比蒸馏),没有 1B 参数模型,也没有任何权重文件——它是一套调用现成 mlx-community/Qwen2.5-1.5B-Instruct-4bit 的并行约束解码推理代码,跟 RLCD 毫无关系。 - [Claude for Small Business:43 个工作流、27 个集成,从聊天变成"跑整周流程"](https://blog.mushroom.cv/blog/claude-for-small-business-43-workflows-27-integrations-cowork-2026/): Anthropic 2026-09-15 扩容 Claude for Small Business,新增 43 个工作流、27 个集成,接入 Shopify、Salesforce、TikTok、Stripe、Xero、QuickBooks、Zapier 等工具。核心变化是从「回答问题」变成「围绕一个结果持续跑流程」:周一经营简报、线索自动跟进、语音备忘录变提案、每月对账关账。运行在 Claude Cowork 桌面应用,默认需批准后才真正执行动作。900,000+ 次安装,客户自述案例来自 Anthropic 官方,不代表普遍结果。 - [God's Eye View:浏览器里的卫星侦察视角,数据全是真实的,MIT 开源,35K Stars](https://blog.mushroom.cv/blog/gods-eye-view-browser-geospatial-intelligence-real-data-3d-globe/): bilawalsidhu/gods-eye-view,35K stars,MIT 开源,JavaScript + CesiumJS + WebGL + Google 3D Tiles。浏览器里的地理空间情报平台:15 个实时数据层,包括 11,000+ 架飞机、全球船只、838 颗卫星轨道、地震、CCTV、NASA 火灾探测。支持语音控制、座舱视角、热成像传感器模拟。无需 API Key 即可启动。 - [Hypit:给 Claude Code 和 Codex 一套视频制作语言,一条命令复刻爆款](https://blog.mushroom.cv/blog/hypit-ai-agent-video-workflow-svml-claude-code-codex/): Hypit 为 Claude Code、Codex 等 Coding Agent 提供 SVML 视频工作流语言和渲染系统。词语锚定而非秒数锚定,一条视频进去输出完整 workflow:画面、字幕、B-roll、特效,可批量生成 100 个变体。Apache-2.0 附条件,3860 stars,TypeScript。 - [OpenDisplay:免费开源 Sidecar 替代,iPhone/iPad/旧 Mac 变真副屏](https://blog.mushroom.cv/blog/opendisplay-free-open-source-sidecar-iphone-ipad-second-monitor/): Sidecar 要同一 Apple ID、不支持 iPhone;Duet 改了订阅;Luna 要加密狗。OpenDisplay 全都不要:免费、开源、无账号、无加密狗,USB 或 WiFi,H.264 硬件编码,Retina HiDPI,触控输入,旧 Mac 也能当副屏。GPL-3.0,macOS 私有 API CGVirtualDisplay。 - [Chift 融资 1050 万欧元:中小企业金融 AI 的瓶颈可能是连接器,不是再造一个财务 Agent](https://blog.mushroom.cv/blog/chift-financial-connector-layer-sme-ai-funding/): 欧洲金融连接创业公司 Chift 完成 1050 万欧元 A 轮融资,官网自称打通 150+ 连接器,多家媒体报道称覆盖 50,000+ 家企业;但连接系统数(120+ 还是 150+)、覆盖国家数(13 个还是 27 个)说法在不同一手源之间互相打架。更值得记的是:它的 MCP 服务器和 AI 字段映射已经上线,融资真正要建的是「自动配置集成」这一层。 - [Claude for Financial Advisors 拆解:垂直 AI 正在变成「连接器+技能+审批+审计」的打包件](https://blog.mushroom.cv/blog/claude-financial-advisors-connector-skill-approval-pattern/): Anthropic 2026年9月14日发布 Claude for Financial Advisors,打包约18个连接器和8个工作流技能,定价70-120美元/用户/月,交易和合规决策仍必须人工批准。本文核实三条一手源,判断这套模式对中国中小企业和独立开发者的可复制性与局限。 - [2833 星的 Claude 交易技能包:74 个 Skill 覆盖选股到复盘,但它明确说自己不下单](https://blog.mushroom.cv/blog/claude-trading-skills-tradermonty-stock-workflow-toolkit/): tradermonty/claude-trading-skills 是一套 MIT 协议的 Claude Code 交易工作流技能包,2833 星、647 fork,74 个 Skill 分 6 大领域,覆盖选股筛选、仓位计算、复盘记账,但作者反复强调不是信号服务、不自动下单、不构成投资建议。 - [DSH Remote:让 DeepSeek Harness 跑在 Mac 上,手机通过 Tailscale 私网远程控制](https://blog.mushroom.cv/blog/dsh-remote-deepseek-harness-mobile-tailscale-pwa-mac/): MIT 开源,TypeScript,社区独立项目。通过私有 Tailscale 网络把 DeepSeek Harness 变成手机可用的 PWA——发起任务、跟进 Agent、处理审批、回答提问,凭据和设置只留 Mac 本机,不接入公网。LaunchAgent 自启,Harness 停止后自动退出。 - [Dunhuang Aura Skill:把敦煌矿物美学封装成 AI Skill,装进 Codex 和 Claude Code 直出商业图](https://blog.mushroom.cv/blog/dunhuang-aura-skill-ai-commercial-visual-codex-claude-code/): MIT 开源,不是 prompt 模板,而是完整视觉规则体系:炭黑洞窟、朱砂石绿飘带、三层景深、克制赭石金光。安装进 Codex 或 Claude Code,直接生成商业封面、电商主视觉、文章头图、多尺寸延展。106 stars。 - [Immich:114K Stars 的自托管 Google Photos,为什么它是目前最成熟的开源替代方案](https://blog.mushroom.cv/blog/immich-self-hosted-google-photos-alternative-114k-stars/): AGPL-3.0 开源,NestJS + SvelteKit + Flutter,完整的人脸识别、CLIP 语义搜索、RAW 支持、OAuth 登录、Docker 部署。114K stars,2022 年创建,持续活跃更新。自托管不等于备份——3-2-1 原则是必须的。 - [MiniMax H3 加速五件套:稀疏注意力、混合注意力、并行解码,15 秒视频压进 6.6 秒](https://blog.mushroom.cv/blog/minimax-h3-accelerated-fasth3-sol-h3-vdn-pdd-lightx2v-five-open-source-speedups/): MiniMax 官方 Spotlight 点名五个开源加速方案:FastH3(VSA 4步蒸馏)、Sol-H3(免训练动态稀疏+fused kernel)、VDN(混合线性+softmax注意力)、PDD(并行解码头蒸馏)、LightX2V Turbo(DMD LoRA)。8×B300 将 15 秒视频压进 6.6 秒;DGX Spark 两阶段 Pipeline 在桌面级硬件上完成 1344×768 多模态生成。 - [腾讯开源 AuK:1.5B 语音生成+编辑大一统模型,Mac 能跑到多小内存?](https://blog.mushroom.cv/blog/tencent-auk-speech-model-mlx-apple-silicon/): 腾讯混元开源 AuK,1.5B 扩散 Transformer 用一句自然语言指令统一 16 项语音任务(零样本克隆、内容编辑、变调变速、降噪分离),MIT 协议、GitHub 939 星。官方 MLX 分支给出 Mac 实测数据:8-bit + 顺序加载可压到 6.1GB,但这条路径还在未合并的实验分支上。 - [Webwright:微软开源的浏览器 Agent,Code-as-Action 在 Mind2Web 上拿到 86.7%](https://blog.mushroom.cv/blog/webwright-microsoft-browser-agent-playwright-code-as-action/): MIT 开源,~450 行核心循环,用 Playwright Python 脚本替代像素坐标点击。Online-Mind2Web GPT-5.4 86.7%,Odysseys 长时域任务 +15.6pp SOTA,Skill Factory 将 WebArena 准确率从 55% 提升至 70%。6K stars,微软出品。 - [OpenSwarm:把 Claude Code + Codex 组成自主开发团队,从 Linear issue 到 PR 全自动](https://blog.mushroom.cv/blog/openswarm-autonomous-ai-dev-team-claude-code-linear/): MIT 开源的 AI 开发团队编排器:从 Linear 拾取任务,Worker/Reviewer 对儿流水线,LanceDB 每仓库认知记忆,PR 自动驾驶,CI merge gate,SWE-bench Lite Hybrid 模式 3/3 解决。856 stars,TypeScript。 - [VoiceMem:流式双脑架构,给语音 Agent 装上真正的记忆](https://blog.mushroom.cv/blog/voicemem-streaming-dual-brain-voice-agent-memory/): 清华团队的 VoiceMem 用左脑存事实、右脑存情感,流式投机预取让检索在你说完之前就跑完,LoCoMo 达到 91.2%,比 Mem0 快 10x、省 16x token,Apache 2.0 永久开源。 - [VoiceStudio:24.8K Stars 的本地 ElevenLabs 替代方案,16 个 TTS 引擎跑在你的机器上](https://blog.mushroom.cv/blog/voicestudio-local-elevenlabs-alternative-tts/): AGPL-3.0 开源,无账号无订阅无计费,646 种语言,语音克隆 3 秒起步,视频配音、有声书、MCP Server 全齐——这是目前功能最完整的本地语音 AI 工具之一。但默认引擎权重是 CC-BY-NC,商用前必须核查。 - [XKAgent:用写代码代替调工具,一个纯 Python 的极简 Agent Runtime](https://blog.mushroom.cv/blog/xkagent-code-over-tools-python-agent-runtime/): XKAgent 用 pythonrt 让模型直接写 Python 代码执行任务,不需要预定义工具——一个执行原语覆盖所有能力。配合 Skills 热加载、Status 状态注入、mail.jsonl 多 Agent 邮件总线,29 stars,MIT 开源,值得关注的设计思路。 - [Edge0-35B-A3B 拆解:35B MoE「3GB 内存跑 15 tok/s」,靠的是砍掉一半专家和预测路由](https://blog.mushroom.cv/blog/edge0-35b-a3b-ssd-expert-offload-prerouter-mac/): Edge0-35B-A3B 把 Qwen3.5-35B-A3B 做成 4-bit 专家放 SSD、按需读入:官方称峰值内存 2.9GiB、M4 Pro 24GB 上 14.9–17.7 tok/s、质量比 fp16 低 3.9 分。拆开看,它把每 token 激活专家从 8 个减到 4 个,并用 prerouter 预测结果直接替代原路由;3GB 只算 MLX 分配器峰值,不含页缓存。我们在 16GB M4 Mac mini 上实测 SSD 随机读,全部未命中时 K=4 的读盘上限约 11.4 tok/s。许可证是 Apache-2.0。 - [LocalAGI 拆解:这个本地 Agent 平台已被 LocalAI 收进核心,Mac 用户该装哪一个?](https://blog.mushroom.cv/blog/localagi-local-ai-agent-platform-localai-mac/): mudler/LocalAGI(1972 星,MIT,Go)自称 OpenAI Responses API 的「完整替代」、不上云。我们读完 README、compose 和代码:/v1/responses 里 stream、temperature、instructions 等 7 个字段解析后没被用上,12 个 release 附件全是 0,默认 compose 在局域网暴露 root:root 的 SSH;它从 2026 年 3 月起已被 4.9 万星的 LocalAI 内嵌。Mac 用户直接装 LocalAI.dmg 最省事。 - [Miles v0.1:SGLang 团队填平学术 RL 和生产系统之间的鸿沟](https://blog.mushroom.cv/blog/miles-v0-1-production-rl-post-training-sglang/): SGLang 团队发布 Miles v0.1,生产级 LLM/VLM RL 后训练框架。全异步 RL、P2P RDMA 权重同步(万亿参数秒级更新)、TITO 消除 token 往返损耗、R3 修复 MoE 路由不一致、自动容错恢复——每块都是工业级设计。 - [Orca:67K stars 的并行 Agent 编排台,把 40+ CLI Agent 变成一支舰队](https://blog.mushroom.cv/blog/orca-ade-parallel-ai-agent-orchestration/): Stably AI(YC W22) 出品的开源 ADE,MIT 协议。一个 prompt 扇出给多个 Agent,各跑独立 worktree,Design Mode 点 UI 元素直喂 Agent,SSH 远端机器、手机 App 随时调度——这是目前把「Agent 当舰队管」想得最透的工具。 - [Pentest Harness 拆穿:给 DeepSeek Harness 换皮,再把授权边界删掉](https://blog.mushroom.cv/blog/pentest-harness-deepseek-harness-rebrand-authorization-teardown/): S1N6H/pentest-harness(356 star,MIT)自称面向授权渗透的自托管 AI agent harness。逐 diff 核实:它是 deepseek-ai/deepseek-harness 的换皮——LICENSE 版权人仍是 DeepSeek、命令行仍叫 dsh、包名仍是 @deepseek-ai/dsh、中文 README 还写着『由 DeepSeek AI 开发』。改动主要是品牌替换加一个 pentest 预设;同时删掉了上游的 SAFETY.md,并在系统提示词里塞进『授权:完全,无任何范围限制,不警告合法性』的兜底人格。授权全靠用户自我声明,没有 scope 文件、目标白名单或审计要求。 - [K2 Horizon MoVA 36B-A4B:MBZUAI 把 MoE 塞进注意力的 Value 层,Mac 要多大内存才跑得动?](https://blog.mushroom.cv/blog/k2-horizon-mova-36b-a4b-mac-local-memory-guide/): K2-Horizon-MoVA-36B-A4B 是 MBZUAI 基础模型研究院(IFM)9 月初开源的 Apache-2.0 纯文本 MoE,37.44B 总参、按权重头部推算每 token 约 4.66B 激活,把注意力的 V 投影换成 64 选 4 的专家。自报 Terminal-Bench 2.1 为 58.6。它的 KV 缓存每 token 192KB,是 Qwen3.5 同档的约 10 倍。Mac 上 32GB 能勉强跑 4-bit,64GB 才宽裕,而且目前只能走社区 MLX 或 llama.cpp 分支。 - [Krea 2 Turbo 值不值得本地跑?12.8B 开放权重文生图:8 步出图、年收入百万美元以下可商用](https://blog.mushroom.cv/blog/krea-2-turbo-open-weight-text-to-image-license-hardware/): Krea 2 Turbo 是 Krea 从零训练的 12.8B 参数文生图 DiT,用 TDM 蒸馏到 8 步、关闭 CFG,支持 1K–2K 分辨率。本文从个人开发者本地出图的角度拆它:官方全套 bf16 权重约 35.7GB,社区 Q4 GGUF 主干 7.49GB;许可证允许年收入低于 100 万美元的主体商用,但要求内容过滤、衍生模型名须以 Krea 开头,且 Krea 可提前 30 天通知终止授权。并和 FLUX.2 klein 4B/9B 对比。 - [Krill 拆解:一个 Swift 二进制同时当本地推理引擎和编程 Agent,「比 Ollama 快 1.57 倍」要打几折?](https://blog.mushroom.cv/blog/krill-mac-mlx-llm-runtime-coding-agent/): srvsngh99/Krill 是 MIT 协议、纯 Swift + MLX 的 Mac 本地大模型运行时,同一进程里还跑着编程 Agent,并对外提供 OpenAI / Ollama / Anthropic 三套接口。我们读完 README、基准文档和源码并在 Mac mini 上跑了发行版:作者自己的数据显示单流解码与 Ollama 的 MLX 引擎持平(0.95x),真正的优势在并发(约 2 倍)、冷启动(2.9 倍)和 Gemma 长上下文;另外它默认开启的 n-gram 投机解码,自家的一致性测试已连续 6 周失败。 - [Nex-N2.5-mini:35B 总参、约 3B 激活的开源 Agent 模型,Mac 要多大内存才跑得动?](https://blog.mushroom.cv/blog/nex-n2-5-mini-agentic-moe-mac-local-memory-guide/): Nex-N2.5-mini 是 Nex-AGI 9 月 8 日开源的 Agent 模型,Apache-2.0,35.1B 总参 MoE、按权重头部推算每 token 约 2.95B 激活,底座是 Qwen3.5-35B-A3B-Base。本文按社区量化体积推算 Mac 内存门槛:32GB 起步能跑 4-bit,48GB 才宽裕;并对照同底座 Qwen、云端价格和 Claude Code/OpenCode 接入方式。 - [obsidian-skills 上手:让 Claude Code 把 Obsidian 库当本地记忆层,Obsidian CEO 亲自写的 6 个 skill](https://blog.mushroom.cv/blog/obsidian-skills-agent-vault-local-memory/): kepano/obsidian-skills 是 Obsidian CEO Steph Ango 亲自维护的 Agent Skills 集合,48137 星、MIT。本文逐个拆解 6 个 skill 教 agent 做什么、写法上哪里值得学,给出把 Obsidian 库接成 Claude Code/Codex 本地记忆层的完整上手路径,并核实踩坑点:CLI 需 1.12.7+ 安装包且依赖桌面端运行、Bases skill 漏了 Kanban 视图、9 月 10 日新增 Knap 模板 skill。 - [Pilot Protocol 拆解:MCP 给 Agent 工具,它想给 Agent 同伴——但 435 个「专家」都跑在同一台机器上](https://blog.mushroom.cv/blog/pilot-protocol-mcp-agent-p2p-overlay-network/): 读完 pilot-mcp 和 Pilot Protocol 主仓库的代码后的独立核实:P2P 加密隧道和 NAT 穿透是真的,但注册中心、中继和 435 个专家 agent 都由 Vulture Labs 在 GCP 上集中运营;节点 ID→公钥映射默认走明文 TCP;四项数据相关功能默认开启。 - [StandRig:AI 直接当 rigger,MCP 原生的 2D 角色建模系统](https://blog.mushroom.cv/blog/standrig-ai-2d-rigging-mcp-psd-cubism/): 开发者预览版开源工具:把分层 PSD 喂给本地服务,Claude Code 等 AI 通过 MCP 直接编辑 Mesh、Deformer 和参数,配套 cubism-api-bridge 打通 Live2D Cubism Editor。AI 不再是辅助,而是替代了传统 rigging 的手工部分。 - [Virtual AI Infra Team 拆解:让本地 27B 自己挑加速方案,18→37 tok/s,但「团队」里只有一个 AI](https://blog.mushroom.cv/blog/virtual-ai-infra-team-local-llm-self-upgrade-dflash2-mac/): hsj576/virtual-ai-infra-team 不是多 agent 角色扮演,而是一个给本地大模型做「自动测速、升级、回滚」的控制器:模型只提计划,确定性代码判决。README 的 18.14→37.52 tok/s(+106.84%)我们重算无误,但这个中位数来自代码题;按提示词拆开,散文题只快 50.6%,9 个样本的均值是 +89%。167 个测试本机全过,4 道质量门禁题被我们一句话骗过,候选库里只有 1 个加速方案。 - [YuE2-3B:先写谱再唱歌的开源音乐模型,和 ACE-Step 1.5 差在哪](https://blog.mushroom.cv/blog/yue2-3b-open-source-song-generation-editable-score/): YuE2-3B 开源歌曲生成:歌词+风格先出可编辑 ABC 乐谱再合成 48kHz 立体声,Agent 可改和弦改旋律再生成;RTX 4090 上 3.6 分钟歌 71 秒。本文对比 ACE-Step 1.5,拆解「超过 Suno v5」的自家基准与 best-of-8 前提、云上每首歌边际成本估算、CC BY-NC 非商用协议和 Mac 现状。 - [CloddsBot:基于 Claude 的开源 AI 交易 Agent,自主横扫 1000+ 市场](https://blog.mushroom.cv/blog/cloddsbot-ai-trading-agent-1000-markets/): 开源 AI 交易 Agent,跨 Polymarket、Kalshi、Binance、Hyperliquid、5 条 EVM 链等 1000+ 市场自主操作,内置 118+ 策略和机器对机器支付协议,自托管,基于 Claude 驱动。 - [R8 混淆藏不住的那串字符串:一个 Claude Code Skill 把 APK 的 API 挖出来](https://blog.mushroom.cv/blog/android-reverse-engineering-claude-code-skill-r8-kotlin-name-recovery/): SimoneAvogadro/android-reverse-engineering-skill 是一个 7744 stars、Apache-2.0 的 Claude Code 插件,反编译 APK/XAPK/JAR/AAR 并提取 HTTP API。最聪明的一招是 Kotlin 名字恢复:R8 能重命名 JVM 符号,却不能删掉 Kotlin metadata 字符串——因为 Kotlin 反射和协程运行时需要原始全限定名。这个 skill 从 @Metadata / @DebugMetadata 注解里重建「混淆名 → 真名」映射表,对典型应用能恢复约 100% 的 Repository / ViewModel / UseCase 类名。 - [一个 _worker.js 文件就是全部:CF-Workers-CheckProxyIP 在 Workers 上做 TCP/TLS 连通性体检](https://blog.mushroom.cv/blog/cf-workers-checkproxyip-single-file-worker-tcp-tls-probe/): cmliu/CF-Workers-CheckProxyIP 把页面、DNS 解析、TCP/TLS 探测全塞进一个 _worker.js,复制粘贴进 Cloudflare 控制台就能跑。技术看点是它用 cloudflare:sockets 在 Worker 里真的建 TCP 连接做 TLS 握手,再靠两个固定探针推断候选目标是 ipv4_only 还是双栈。免费套餐的子请求上限逼出了「每批最多 15 个域名、3 秒重试、连续 3 次放弃、32 并发检测」这套工程约束。663 stars、446 forks。注意:README 自称 MIT,实际 LICENSE 文件是 GPL-3.0。 - [用「编译」替代反复调大模型:Compile by Training 如何把 NLP 任务固化成本地神经函数](https://blog.mushroom.cv/blog/compile-by-training-local-neural-functions/): 用自然语言描述一次任务,让教师模型在编译期生成样例并训练小适配器,之后永远在本地跑——成本、延迟、供应商依赖一次性切断。FuzzyBench-Hard 达到 83.6% 语义准确率。 - [Ferrum:一个 Rust 二进制跑本地推理,Metal 和 CUDA 共用同一套 runtime](https://blog.mushroom.cv/blog/ferrum-infer-rs-rust-single-binary-local-llm-metal-cuda/): sizzlecar/ferrum-infer-rs 是一个纯 Rust 的本地推理引擎:单个二进制、无 Python 运行时,Apple Silicon Metal 与 NVIDIA CUDA 共用同一个 runtime,提供 OpenAI 兼容的 Chat Completions 和 Responses API。README 里给了带 95% 置信区间的实测吞吐——M1 Max 32GB 上 Qwen3.5 4B 并发 16 时 61.9 ± 0.1 tok/s,RTX 4090 上 241.3 ± 0.6 tok/s。MIT 协议,14 stars。 - [同一个 27B,换条路跑:HauhauCS 的 GGUF 版用 FastMTP 投机解码把生成速度拉到 3 倍](https://blog.mushroom.cv/blog/hauhaucs-qwen3-8-27b-gguf-fastmtp-speculative-decoding-kp-quant/): HauhauCS/Qwen3.8-27B-Uncensored-Aggressive-MTP-GGUF 是 Qwen3.8-27B 的 GGUF 量化发布,1048 likes、171 万次下载。两个技术点值得看:一是 K_P「完美」量化——按模型做针对性分析选择性保质,体积只多 5-15% 却相当于提升一到两个量化档;二是 FastMTP,一个 903MB 的 32K 草稿旁车,配合打过补丁的 llama.cpp,文档生成最高 3.02 倍、推理生成 1.93 倍于关闭 MTP。全部 GGUF 带 Ed25519 签名清单和张量指纹。但所有基准跑在 96GB 的 RTX PRO 6000 Blackwell 上,数字不能直接搬到个人机器。 - [本地跑大模型真的更便宜吗?这个插件把每 100 万 token 的成本算到了 0.62 美元](https://blog.mushroom.cv/blog/hermes-local-rig-accounting-real-cost-per-token/): 本地推理不是免费的——电费、硬件折旧、机会成本都是真金白银。hermes-local-rig-accounting 是一个 Hermes Agent 插件,用一套可审计的公式把这些隐性成本折算成「每百万 token 多少钱」,并直接和云 API 报价放在一起对比。示例配置下算出 0.62 美元/M tokens,全部数据留在本地,无遥测。 - [一个日语动漫风 TTS 微调模型,附带五种量化版本——以及一句很诚实的免责声明](https://blog.mushroom.cv/blog/irodori-tts-anime-japanese-local-tts/): Irodori-TTS-v4.1-Anime 是基于 Irodori-TTS-v4.1-Small 用动漫风语音数据微调的日语 TTS 模型,MIT 协议,同时提供 int8/int4/float8 共五种量化变体。作者主动写明:基座模型的标注流程未公开,微调数据是独立标注的,所以 caption 条件控制和 emoji 控制的行为可能和基座不一样。 - [本地跑了七八个模型服务,端口和参数全靠记?LLM-Dock 用 Docker Compose 给你一块面板](https://blog.mushroom.cv/blog/llm-dock-docker-compose-local-llm-dashboard/): LLM-Dock 是一个管理本地 LLM 推理服务的 Web 面板:自动扫描 HuggingFace 缓存发现模型,llama.cpp 跑 GGUF、vLLM 跑 safetensors,3300-3400 端口段自动分配,一键起停,自动注册进 Open WebUI,还能在面板里直接跑 llama-bench 并把结果存库对比。前提是 Linux + NVIDIA。 - [2B 打赢 4B:面壁 MiniCPM5-2B 拿下同级开源 SOTA,还把训练数据全开源了](https://blog.mushroom.cv/blog/minicpm5-2b-on-device-sota-small-model/): MiniCPM5-2B 是一个 25 亿参数的稠密模型,原生 131072 上下文,为端侧和资源受限场景设计。在官方对比集里平均分 53.9,不仅是 2B 级开源 SOTA,还超过了所有列入对比的 4B 级模型(最高 51.1)。优势集中在代码推理、数学推理、长上下文、工具调用和 Agent 任务。同时开源了背后的四套训练数据集。 - [Trinity:每个 Agent 一个 Docker 容器,把「Claude Code 写的 Agent」搬进有审计的生产环境](https://blog.mushroom.cv/blog/trinity-abilityai-sovereign-agent-platform-per-agent-docker-audit/): Abilityai/trinity 是一个 Apache-2.0 的自托管 Agent 平台,口号是「Claude Code 写 Agent,Trinity 跑它」。每个 Agent 独占一个 Docker 容器,配 cron 调度 + Redis 分布式锁、四层 RBAC、只追加的平台审计日志、人在环的 Operator Queue、OpenTelemetry 成本与 token 追踪。每个 Agent 可分别选 Claude Code / OpenAI Codex / Gemini CLI 三种 runtime。523 stars、89 forks,通过 UnderDefense 独立渗透测试 Grade A,还内置了 x402 付费 Agent 访问。 - [把一张画变成「有人正在画」:whiteboard-animator 用纯 CPU 做手绘揭示动画](https://blog.mushroom.cv/blog/whiteboard-animator-cpu-only-hand-drawn-reveal-render-engine/): masihsultani/whiteboard-animator 是 Kinoslide 白板格式背后的渲染引擎,MIT 开源。给它一张画好的白板风格图,它按人手的顺序把图重画出来:文字逐词书写、轮廓单笔勾勒、填充按面积决定用扫掠还是刷毛笔触、带交叉的线条图拆成连续笔画,所以 X 不会从中间长出来。渲染时除了一个 83MB 的 CRAFT 文字检测器没有任何模型——无 GPU、无训练、无 API Key。90 stars,2026-09-08 建仓。 - [Nikola:把话题变成手绘讲解视频的 Codex Skill](https://blog.mushroom.cv/blog/nikola-hand-drawn-explainer-video-codex-skill/): 中文手绘知识讲解视频 Codex Skill,逐笔故事动画与程序动画双路径,VolcanoEngine TTS 配音,输出真实 MP4+字幕+时间轴,无需本地模型,Apache 2.0 开源。 - [OJO Design Skills 正式开源:给 AI Coding Agent 装上真正的审美](https://blog.mushroom.cv/blog/ojo-design-skills-open-source/): OJO 团队开源了 AI coding agent 设计 skill 包,双轨方法论(规约/创新赛道)强制 agent 先提方向再动 token,9 份规范文件覆盖完整设计链路,支持 Claude Code、Codex 等 7 个 agent 客户端。 - [IU4 原生 4bit 通道:AMD Strix Halo 上让量化从「省显存」变成「算得快」](https://blog.mushroom.cv/blog/kairic-edge-iu4-strix-halo-native-4bit-lane-qwen38-27b/): jcbtc/Qwen3.8-27B-IU4-Kairic-Edge 是已知第一个在 AMD gfx1151 上跑通加速 IU4 通道的 LLM,Apache-2.0。多数「4bit 模型」只是 4bit 存储、算之前还要展开成更宽格式;它把 4bit 权重和激活直接喂进 RDNA 3.5 的 V_WMMA_I32_16X16X16_IU4 指令。实测 104.66 TOPS(FP16 的 1.94 倍)、47.73 tok/s(比 Unsloth Q4 快 85%)、HumanEval Plus 152/164。但作者自己标明这是「配置系统对比」而非单变量实验,还主动撤下了一个会改变输出的加速路径。 - [PraisonAI:把 Agent 拆成五层,每层只回答一个问题——出了问题你知道该看哪一层](https://blog.mushroom.cv/blog/praisonai-five-layer-agent-stack-managed-agents/): 多数 Agent 框架给你一两层,剩下的当作业留给你。PraisonAI 把 Agent 拆成 Prompt / Context / Harness / Loop / Graph 五层,每层对应一个调试时该问的问题,外面再套一层「它到底在哪台机器上跑」。9027 stars、1435 forks、MIT、Python,2024-03-19 建仓至今仍在日更。支持 100+ LLM,doom-loop 检测默认开启,tools_run_on= 一个参数把工具挪进 Docker/E2B/Modal 沙箱而思考仍留在本机。也有该泼的冷水:14μs 实例化是个没什么信息量的数字,25 个特性堆在一个包里意味着 API 面积很大。 - [Wemux:把 AI Agent 的活儿放回你自己的机器上跑,控制面不碰你的代码](https://blog.mushroom.cv/blog/wemux-self-hosted-agent-orchestration-worker-first/): 云端 Agent 平台的通行做法是把你的仓库拉进它们的沙箱。Wemux 反着来:控制面只做规划、路由和评审,真正的编码执行发生在你自己的 worker 机器上,跑在隔离的 Git worktree 里,用你自己的凭据。Apache-2.0,TypeScript 占 16.2 MB,69 stars、13 forks、58 次提交——2026-08-25 才建仓,13 天大的新项目。自托管社区版包含控制面、worker、BYOK、飞书/Slack/钉钉/企微/微信/WhatsApp 六个 IM 通道和 Electron + React Native 客户端;托管模型网关、计费和云节点池是单独的商业服务,不在这个仓库里。 - [一个 5 行的 skill,和 Anthropic 那四个容易搞混的插件仓库](https://blog.mushroom.cv/blog/anthropic-plugin-marketplaces-four-repos-eli5-minimal-skill/): 网上流传「Anthropic 公开了内部员工高频使用的 Claude Code Skill——ELI5」。回查一手源:它确实存在,但不在官方 skills 仓库,而在社区插件市场 anthropics/claude-plugins-community,署名作者 Thariq Shihipar,MIT。「内部员工高频使用」这个说法找不到一手依据。顺着这条线把 Anthropic 的四个插件/skill 仓库理清楚:skills(19 个 Agent Skills)、claude-plugins-official(官方目录)、knowledge-work-plugins(按职能分的 Cowork 插件)、claude-plugins-community(社区提交、目前 4 个)。而 ELI5 本身的 SKILL.md 只有 5 行——这才是它真正值得看的地方。 - [「别提交你三小时前刚做的 skill」:一份跨 8 家 agent 的策展清单,和它的四条质量判据](https://blog.mushroom.cv/blog/awesome-agent-skills-cross-vendor-paths-quality-criteria-anti-slop/): 1497 个 agent skill 的人工策展清单,33.8k stars,MIT,明确写着 hand-picked not AI-slop generated。真正有用的是两样东西:一张覆盖 Claude Code、Codex、Cursor、Gemini CLI、Copilot、Windsurf、OpenCode、Antigravity 八家的 skill 目录路径对照表;以及四条具体到能照着改的质量判据——描述要用 agent 能匹配的具体关键词、顶层元数据压到 100 token 以内正文控制在 500 行、不许硬编码绝对路径、不许申请全量工具权限。它的投稿须知和免责声明也值得一读。 - [931 个资源分成四类:awesome-copilot 的分类学,和那个 308KB 给 agent 读的索引](https://blog.mushroom.cv/blog/awesome-copilot-agents-instructions-skills-plugins-taxonomy-llms-txt/): Agents 222 个、Instructions 193 个、Skills 416 个、Plugins 100 个——这套分类本身比清单更值得看:agent 是接 MCP 的专门角色,instruction 是按文件模式自动生效的编码规范,skill 是自包含带资源的文件夹,plugin 是打包好的组合。另一个值得抄的做法是 llms.txt:一份 941 行、308KB 的机器可读索引,专门给 AI agent 读,让它自己找该用哪个资源。需要澄清的是它虽在 github 组织下,但 README 写的是 community-created。 - [DeepSeek Harness 装进安卓手机的四条路线:只有一条真能操作手机](https://blog.mushroom.cv/blog/deepseek-harness-android-four-routes-shizuku-termux-proot/): 把 DSH 搬上安卓有四种做法:原生 APK 走 Shizuku 免 root 系统特权(166★)、Termux 补丁层只有 100KB(51★)、内嵌 Node.js 运行时的 41MB 独立 APK(18★)、Capacitor + PRoot 塞进完整 Ubuntu 24.04 用户空间(5★)。四者都是 MIT,但本质分成两类:三个是「在手机上跑 DSH」,只有一个是「让 AI 操作这台手机」——能点屏幕、装应用、改系统设置。附各路线的权限边界、体积、保活能力对比。 - [DeepSeek-V4-Flash-Vision-Exp:加了视觉塔,文本 agent 能力反而涨了](https://blog.mushroom.cv/blog/deepseek-v4-flash-vision-exp-multimodal-agent-dspark/): DeepSeek-V4 家族第一个实验性多模态模型,8 月 31 日上线,五天 18.4 万下载、651 likes,MIT。在 DeepSeek-V4-Flash 架构上加视觉模块并继续训练:多模态 agent 能力大幅提升,而七项文本 agent 基准里六项不降反升。三项超过 Opus-4.8(DeepSWE 59.3、Agents' Last Exam 27.3、ZeroBench 35.0)。DSpark 推测解码的 draft 权重和 target 来自同一个 checkpoint,不需要单独的草稿模型。但硬件门槛是单节点 4 张 GB300,个人跑不了——这篇讲清楚它是什么、以及为什么还值得关注。 - [92 个 MCP 工具吃掉 27000 tokens:一个 0 star 项目量出了 MCP 的上下文税](https://blog.mushroom.cv/blog/gitlab-mcp-server-92-tools-27000-token-context-tax/): penaivanalejandro/gitlab-mcp-server 是个 0 star 的本地 MCP,但它的 README 干了一件几乎没人做的事:把 92 个工具定义的上下文开销逐组量化——全开 27340 tokens,只开 issues 组 3884 tokens,省 86%。平均每个工具定义约 297 tokens,你还没打字就已经花掉了。附 GITLAB_TOOL_GROUPS 分组加载、GITLAB_READ_ONLY 只读模式、以及 read_api 最小 token 权限这三层收敛方案。 - [拆 google/skills:137 个 Agent Skill 里,86% 是 Google Cloud,67% 写了「别用我」](https://blog.mushroom.cv/blog/google-skills-137-agent-skills-negative-routing-vs-anthropic/): Google 官方 Agent Skills 仓库 19583 星,实测统计:137 个 SKILL.md 里 cloud 占 118 个,index.json 收录 132 个,其中 88 个(67%)在 description 里显式写了「Don't use for X,改用 Y」的负向路由,平均 description 长达 437 字符。这个数字本身就是一条工程结论——当 skill 数量过百,路由歧义才是主要失败模式,Anthropic 建议的简短 description 在这个规模下会失效。 - [GPT-6 Astra 究竟带来了什么:不是更聪明,是第一次能真正帮你干活](https://blog.mushroom.cv/blog/gpt-6-astra-openai-computer-use-breakthrough-what-it-actually-brings/): OpenAI 9月3日发布 GPT-6 Astra。推特上 1.25亿次曝光的那条官方视频说:电脑上能做的一切,Astra 都能替你做。这篇文章拆解 Astra 真正的突破在哪里,哪些用法是真价值,哪些是浪费 token,以及它对专业工作的实际影响。 - [gws:命令面在运行时长出来的 CLI,以及它对本地优先意味着什么](https://blog.mushroom.cv/blog/gws-google-workspace-cli-discovery-dynamic-commands-agent-skills/): 把整个 Google Workspace 收进一个命令行工具,Rust 写的,3 万 stars。工程上最值得看的是它不带静态命令列表:运行时读 Google 的 Discovery Service,用返回的文档动态构建 clap 命令树,Google 加了 API 方法它就自动支持。仓库还带 100 多个 SKILL.md,每个 API 一个,外加 50 个精选 recipe。需要澄清两件事:它挂在 googleworkspace 组织下,但 README 明写不是官方支持的 Google 产品;以及这条路让 agent 更强,数据却仍然全在 Google 那边——本站要连立场一起讲。 - [M3E Canvas:先画 UI 再让 AI 写代码,把设计导出成一份 6 段规格书](https://blog.mushroom.cv/blog/m3e-canvas-material3-sketch-to-structured-prompt-ai-coding/): lnkiai/m3e-canvas 开源项目 4 天冲到 4169 星:在浏览器里拖 Material 3 Expressive 组件、连页面跳转和滑动手势,一键导出成配色/形状/屏幕结构/行为跳转/组件样式/整体原则六段固定结构的 prompt,直接交给 Claude Code、Codex、Gemini CLI。真正的增量不是「AI 画 UI」,而是把设计意图变成 prompt 里可校验的结构。纯前端无后端,数据不出浏览器。 - [Spark-X2.5-4B:一个 4B 模型在 Agent 榜上打穿 9B,但 GGUF 只放了未量化版](https://blog.mushroom.cv/blog/spark-x25-4b-agent-benchmarks-1m-context-local-model/): SparkLLM 开源的 4B 模型 Apache-2.0,原生 1M 上下文靠 1 层全注意力配 3 层滑窗。自报榜单里 τ³-bench 30.4 是 Qwen3.5-9B(9.3)的 3.3 倍,BrowseComp 40.9 是它的 5 倍,MCP-Atlas 54.6 也反超;但 GPQA 67.4 输给 9B 的 77.2——这是典型的「为 Agent 后训练」特征。实测查证:GGUF 仓库只有一个 8.23GB 未量化文件,没有 Q4/Q5,想在 Mac 上跑得自己量化。 - [tare:压缩输入而不是改输出的省 token 方案,无损为默认,还专门绕开前缀缓存](https://blog.mushroom.cv/blog/tare-lossless-context-compression-cache-correct-output-aware/): Rust 写的 LLM 上下文压缩工具,MIT,proxy / CLI / MCP / 库四种形态。三条别家没有的约束:无损为默认(有损手段必须显式开启)、cache-correct(识别前缀缓存断点,只压动态后缀,不让一个改动的字节作废 10 倍缓存折扣)、output-aware(压过头模型会用更啰嗦的输出补偿,它监测输出 token 尖峰并自动降低压缩力度)。实测 43.8–73.3%,语料和复现脚本都提交在仓库里。9 个 crates、228 个测试。 - [TokenTracker:省 token 之前,先确认你手上的数字没多算 1.6 到 3.7 倍](https://blog.mushroom.cv/blog/tokentracker-local-first-token-cost-accounting-dedup/): 本地优先的 AI 编程工具 token 与成本统计,覆盖 36 个工具,1522 stars,MIT。真正的技术点在去重:基于 reqId 的去重(ccusage 那一类)对不返回 request ID 的 provider —— DeepSeek、Kimi、MiniMax、Claude 子 agent —— 会超算 1.6 到 3.7 倍;TokenTracker 改用复合键,总数能和各家账单对上。36 个集成里绝大多数是 passive reader,只读工具自己产生的文件,从不读 prompt。附带遥测开关的准确说明。 - [ZINC:用 Zig 写的本地推理引擎,给那些买了 A 卡却被本地 AI 圈忽略的人](https://blog.mushroom.cv/blog/zinc-zig-inference-engine-amd-rocm-local-gguf/): 本站的本地推理选题长期压在 Apple Silicon 和 CUDA 上,AMD 这条线一直是空白。ZINC 用 Zig 写,一个二进制里装下命令行、浏览器聊天、模型管理器和 OpenAI 兼容 API,512 stars,MIT。在 Radeon AI PRO R9700 + ROCm 上,六个模型的 prefill、decode 和合计耗时全面快过对照的 llama.cpp 构建,同 GPU 同 GGUF 同 prompt 同预热。后端覆盖 AMD 的 Vulkan 与 ROCm、Intel Arc 的 Vulkan、Apple Silicon 的 Metal 和实验性 CUDA。门槛是要自己用 Zig 编译,仓库没有发布二进制。 - [AgentSight:用 eBPF 从系统边界看 AI Agent 到底干了什么,不用装 SDK 也不用挂代理](https://blog.mushroom.cv/blog/agentsight-ebpf-boundary-tracing-ai-agent-observability/): eunomia-bpf 开源的 AI Agent 系统级可观测性工具,669 stars,MIT,Rust + C。核心是「边界追踪」(boundary tracing):在 SSL/TLS 调用处截获 LLM 明文流量拿到语义意图,同时用 eBPF 抓内核事件看真实副作用,再把两条流按因果关联起来。不需要 SDK、不需要网关代理、闭源 CLI 也能观测,论文实测开销低于 3%。已发表于 arXiv:2508.02736 并有 ACM DOI。能检出 prompt injection、推理死循环和多 agent 协调瓶颈。 - [Meta Muse Voice Transcribe:MSL 首款实时音频感知模型,单模型做 ASR + 说话人分离 + 端点检测](https://blog.mushroom.cv/blog/meta-muse-voice-transcribe-realtime-asr-diarization-msl/): Meta Superintelligence Labs 发布 Muse Voice Transcribe,首款实时音频感知模型,单模型集成流式 ASR、20+ 说话人分离和端点检测,支持多语言无缝切换,通过 RL 训练的自适应延迟机制登顶 Artificial Analysis 流式语音识别和公开说话人分离排行榜。 - [Netic:一张高额电费单催生的 4.5 亿美元 AI 收入引擎](https://blog.mushroom.cv/blog/netic-melisa-tokmak-ai-revenue-engine-trades-convert-cultivate/): Melisa Tokmak 从一张几千美元电费单出发,发现美国 5000 亿美元服务业的接电话黑洞,创办 Netic,把「AI 接电话」重新定义为 AI 收入引擎——Convert 负责转化,Cultivate 负责主动出击,Netic Brain 专门训练于服务业工作流。 - [VoiceStudio:本地运行的 ElevenLabs 替代品,16 个 TTS 引擎,646 种语言](https://blog.mushroom.cv/blog/voicestudio-local-elevenlabs-alternative-646-languages-16-tts-11-asr/): debpalash/VoiceStudio ⭐12712,开源全本地语音工作台,16 个 TTS 引擎、11 个 ASR 引擎、646 语言目录,覆盖声音克隆、声音设计、视频配音、转录、故事和 Audiobook,桌面端 + REST/WebSocket/OpenAI 兼容 API + MCP Server,AGPL-3.0。 - [Grok Build:xAI 开源 Rust 编码 Agent,全屏 TUI + ACP 协议](https://blog.mushroom.cv/blog/grok-build-xai-coding-agent-rust-tui-fullscreen-acp/): xai-org/grok-build ⭐26283,SpaceXAI(xAI)开源的终端编码 Agent,Rust 实现,全屏鼠标交互 TUI,支持文件编辑/命令执行/网页搜索/长任务,交互/无头/编辑器嵌入三种模式,ACP 协议,MCP/Skills/插件/沙盒,Apache 2.0。 - [Pulse:一排光环贴着屏幕边缘,告诉你 Claude Code 还剩多少](https://blog.mushroom.cv/blog/pulse-macos-ai-usage-monitor-claude-codex-antigravity-ring/): qunqin24/Pulse 开源,macOS 浮动监控工具,三个彩环实时显示 Claude Code / Codex / Antigravity 用量,贴边停靠收缩为6pt细条,从提供商账户直读真实限额,自适应刷新,无后台零上传,Apache 2.0。 - [Yuxi:把 RAG、知识图谱、多 Agent、MCP 装进一个自部署平台](https://blog.mushroom.cv/blog/yuxi-self-hosted-knowledge-agent-rag-graph-multi-agent-mcp/): xerrors/Yuxi ⭐6591,可私有部署的多租户知识智能体平台,统一 RAG、知识图谱(Milvus+Neo4j)、LangGraph 多 Agent 编排、MCP/Skills、沙盒工作区和团队权限管理,FastAPI+Vue3,Docker Compose 一键部署,MIT 许可。 - [Echo Slides Skill:一行命令装进所有 Agent,从演讲视频自动提取去重幻灯片](https://blog.mushroom.cv/blog/echo-slides-skill-extract-slides-from-video-claude-code-skill/): xiangzhouEcho/Echo-Slides-Skill 开源 Claude Code Skill,npx skills add 一行装到全局,Claude Code/Codex/Cursor/OpenCode 通用,双签名去重(dHash+RGB网格),实测20分钟演讲39页零重复。 - [ExcalidrawZ:4年,把 Excalidraw 做成真正的原生 App](https://blog.mushroom.cv/blog/excalidrawz-native-excalidraw-macos-ios-swiftui-mcp-ai/): chocoford/ExcalidrawZ ⭐1410,纯 SwiftUI 打造的 macOS/iPadOS/iOS Excalidraw 原生客户端,从1.0到2.4.3迭代4年:原生文件管理、iCloud 同步、文件历史、AI 绘图助手、MCP 服务器、LaTeX 公式、文件加密,App Store 已上架。 - [Memory Harness:本地优先、可编排、可审计的 AI 长期记忆工作台](https://blog.mushroom.cv/blog/memory-harness-local-first-programmable-auditable-long-term-memory/): luoyif/memory-harness 开源,六层可追溯记忆架构(Evidence→能力资产),本地混合 RAG,24 个 MCP 工具,多 AI 协作但草稿彼此隔离,完全本地无云依赖。 - [Murmur:一个人的 AI 电台——主动播出、有声音、会记得你](https://blog.mushroom.cv/blog/murmur-radio-companion-ai-radio-voice-host-claude-agent/): wine-fall/murmur 开源,TypeScript 实现的 AI 伴侣电台,Claude Agent 做大脑,自主选题播出+音乐穿插,你打字它用人声回应,有持久记忆和个性,仅需 Claude Code 订阅。 - [PhoneLLM Alpha 1:Pipecat 罕见自研模型,专攻电话语音 Agent 的工具调用](https://blog.mushroom.cv/blog/pipecat-phonellm-alpha-1-voice-agent-model/): 开源语音 AI 框架 Pipecat(15k⭐,本来接 50+ 家 LLM 服务不做自有模型)罕见发布首个自研模型 PhoneLLM Alpha 1:基于 NVIDIA Nemotron 3 Nano 30B-A3B 全参数微调,PhoneBench v1 上性能对齐 GPT-4 Turbo,成本低 94%,P95 首字延迟快 1300ms。 - [StoryFlow AI:7 个 Agent 流水线,一段文字变成一部完整漫剧 MP4](https://blog.mushroom.cv/blog/storyflow-ai-multi-agent-comic-video-generation-script-character-storyboard/): xiaozhang-art/storyflow-ai 开源,Multi-Agent 漫剧自动生成平台,7 步 Agent 流水线(剧本→角色→分镜→图片/配音并行→图生视频→合成),含 Director 决策引擎、断点续传、Montage 渲染引擎,Docker Compose 一键部署。 - [Tailcat:没有 Tailscale 的 Tailscale——零帐号 WireGuard 点对点加密通道](https://blog.mushroom.cv/blog/tailcat-tailscale-data-plane-without-control-plane-wireguard-netcat/): Tailscale 官方开源 Tailcat,用 WireGuard+DERP+magicsock 实现 netcat 风格的加密点对点通道,无需帐号、无需 root、无需改路由表,一个 token 建立直连。 - [Vicoa:手机上发任务,电脑同时跑八个 Agent——ADE 全平台开源](https://blog.mushroom.cv/blog/vicoa-ai-agent-orchestrator-desktop-mobile-worktree-claude-codex/): vicoa-ai/vicoa 全平台开源 ADE(Agent 开发环境),支持 Claude Code/Codex/OpenCode/Gemini/Cursor/Copilot/Kimi/Hermes 八种 Agent,每个 Agent 独立 Worktree 并行,iOS/Android 原生 App,任务面板+定时任务,Docker 一键自部署。 - [WeMM-Embedding-9B:腾讯统一多模态嵌入模型,同尺寸全面超越 Qwen3-VL-Embedding](https://blog.mushroom.cv/blog/wemm-embedding-tencent-multimodal-mrl/): 腾讯微信视觉团队开源的多模态嵌入模型,基于 Qwen3.5-9B,把文本、图像、视频、视觉文档统一映射到同一个 4096 维向量空间,支持 MRL 弹性降维(可截断到 256 维甚至更小而不用重新计算)。2B 和 9B 两个尺寸在 MMEB-v2 上都超过同尺寸的 Qwen3-VL-Embedding,Apache 2.0 协议。 - [Agent Orchestrator(AO):26 个编程 Agent 统一管理,榨干 Claude Code/Codex/Cursor 的实战指南](https://blog.mushroom.cv/blog/agent-orchestrator-ao-26-agents-kanban-orchestrator-fleet-management/): Agent Orchestrator(GitHub: Untrivial-ai/agent-orchestrator,⭐10,439,Apache-2.0)是一个本地桌面 IDE,把 Claude Code、Codex、Cursor 等 26 个编程 Agent 统一放进一个 Kanban 看板管理。每个任务有独立 Worker(独立 branch + worktree)、项目级 Orchestrator 负责规划和拆解任务、实时 Kanban 跟踪 PR/CI/Review 状态、Agent 可控独立浏览器。从想法到 merge 的完整工作流,一个地方搞定。 - [FastVideo:统一的视频生成推理与后训练框架,5秒视频 1.8 秒出图](https://blog.mushroom.cv/blog/fastvideo-hao-ai-lab-unified-video-generation-inference-training/): hao-ai-lab 开源 FastVideo,端到端统一视频生成框架,稀疏蒸馏实现 >50× 去噪加速,支持 Apple Silicon MLX、H100/A100/4090,全平台覆盖。 - [NVIDIA NemotronLabs VoiceChat 11B:首个支持工具调用的开源全双工语音模型,12.5 Hz 帧率,三通道并行输出](https://blog.mushroom.cv/blog/nvidia-nemotron-voicechat-11b-full-duplex-speech-tool-calling/): NVIDIA NemotronLabs VoiceChat 11B(HF: nvidia/NVIDIA-NemotronLabs-VoiceChat-11B,442 likes,OpenMDW-1.1)是首个开源、全双工、支持工具调用的端到端语音对话模型。不是 ASR→LLM→TTS 的串联流水线,而是单一模型以 12.5 Hz(80ms/帧)同时输出文本、工具调用标记、声学编码三个通道。基于 Nemotron-Nano-9B-v2,架构包含 causal FastConformer 语音编码器 + Nemotron 语言模型 + 功能头 + TTS/编解码器四个模块,总 11B 参数。 - [Superset:一个工作区跑 100 个 Agent,Claude Code、Codex、OpenCode 同时干活——普通人上手指南](https://blog.mushroom.cv/blog/superset-parallel-coding-agent-workspace-claude-codex-opencode/): Superset(GitHub: superset-sh/superset,⭐13.5k)是一个 macOS 桌面应用,可以把 Claude Code、Codex、OpenCode 等任意命令行 AI 编程 agent 放进同一个工作区,每个 agent 跑在独立的 git worktree 里,100 个并行互不干扰。内置浏览器、diff 查看器、定时自动化、CLI、MCP Server 接入,iOS 版在路上。免费版永久可用,个人开发者零成本上手。 - [Aegra:LangSmith Deployments 的自托管平替,SDK 不用换,代码不用改](https://blog.mushroom.cv/blog/aegra-self-hosted-langsmith-deployments-alternative/): 调研 Aegra:LangChain LangSmith Deployments(原 LangGraph Platform)的开源自托管平替。同一套 LangGraph SDK、同一套 API,换成自己的基础设施和 Postgres。核心是 Redis 任务队列的 Worker 架构(单实例 30 并发、租约式崩溃恢复、水平扩展)、Postgres 持久化 checkpoint、Agent Protocol v2 流式传输、pgvector 语义存储。LangSmith 免费版不能自托管、企业版才有自定义鉴权和定时任务,Aegra 全部免费内置。创建一年多,周更发布节奏,1129 star,Apache-2.0。 - [Apodex 1.1 Mini 调研:训「持续干活的能力」,不是训「聊得更像」,35B 本地可跑](https://blog.mushroom.cv/blog/apodex-1-1-mini-working-capability-local-agent-guide/): 调研 Apodex/Apodex-1.1-mini:Qwen3.5-35B-A3B(256 专家/8 激活,约 3B 激活参数)的 Agent 微调版,Apache-2.0,图文输入文本输出,中英双语。配套论文 arXiv:2608.23283 提出「working capability」概念——不是比谁推理更强,而是比谁能在文件/搜索/代码环境里持续干活、失败后能恢复、最终交付可验证的结果。训练分两条线:Environment Scaling(扩展可验证的可执行环境多样性)和 Agentic Coordination Scaling(训练拆解长任务、并行委派、整合异步结果、重新规划)。Mini 版本被明确定位为「可本地部署」的那个变体。社区已有 MLX 4/5/6/8-bit、GGUF、NVFP4、GPTQ-Int4 等多种量化版本。 - [LIM 调研:只有 2 星的本地推理管理器,把「KV-cache 永不丢弃」这件事做对了](https://blog.mushroom.cv/blog/lim-stateful-local-inference-persistent-kv-cache/): 调研 statefullm/lim:C++ 写的终端 LLM 控制器,基于 llama.cpp,核心设计是「持久化会话」——KV-cache 从不清空,每轮对话只追加新 token,输入成本是 O(input) 不是 O(total history),跟大多数本地聊天工具「每轮重新处理全部历史」的做法完全不同。自带文件系统工具、网页搜索、PDF 阅读、即时撤销(/undo)和会话存档/恢复。作者自建的基准图表显示三种模式的解码耗时差异,但本文没有本地 GPU 环境实测,如实标注未验证。Apache-2.0,只有 2 星,几乎没人写过。 - [PageIndex:不用向量库的 RAG,3.5 万星背后是真突破还是换了个地方花钱](https://blog.mushroom.cv/blog/pageindex-vectorless-reasoning-rag/): 调研 PageIndex(VectifyAI):用文档结构生成的树索引替代向量库,靠 LLM 在树上推理检索,而不是靠向量相似度匹配。核心主张是「相似度不等于相关性」,在 FinanceBench 上跑出 98.7% 准确率(自家基准,vs 向量 RAG 约 50%)。项目 35354 星、3115 fork、MIT 协议,一年内从 Show HN 冷启动到现在还在周更。但去年那条 HN 讨论(192 赞)里技术圈的质疑也很实在:树结构规模上不去、检索延迟从毫秒级变成秒级到分钟级、所谓「无向量」本质是把成本从建向量库搬到了逐次调用 LLM,缺第三方基准验证。是否该用,取决于你的文档规模和对准确率的容忍成本。 - [Platypus:自托管多租户 Agent 构建平台,看板只是它给 Agent 用的一个工具](https://blog.mushroom.cv/blog/platypus-self-hosted-multi-tenant-ai-agent-platform/): 调研开源项目 Platypus:一个从零构建自定义 AI Agent 的自托管全栈平台——MIT 协议,Next.js + Hono + Docker,69 star。跟本站写过的 Multica(在看板上编排已有 Agent CLI)不是同一类东西:Platypus 的看板只是 Agent 可以调用的一个工具,核心是 Agent/Skill/子 Agent 构建、MCP 接入、可插拔沙箱、自动记忆提取、组织级 Blueprints 模板、多租户隔离,以及不锁定任何模型供应商。本文拆解它跟看板编排类工具的真实差异,以及 Blueprints 这个本站还没写过的设计。 - [ai-job-search:35k Star,一位地球物理学家用 Claude Code 把求职工程化,69 投 20 面 1 offer](https://blog.mushroom.cv/blog/ai-job-search-claude-code-automated-resume-cover-letter-35k-star/): MadsLorentzen/ai-job-search 是一个跑在你自己机器上的 AI 求职自动化框架,基于 Claude Code,三个核心命令:/setup(建立候选人档案)、/scrape(搜索职位并评估匹配度)、/apply(评估 + 定制简历 + 写 Cover Letter + 审稿 Agent + 修订输出)。作者是一位失业地球物理学家,69 份定制申请、20 次初试、1 份 offer,于 2026 年 6 月入职 AI 工程师。现已 35k Star,MIT 开源。 - [macOS Harness:Browser Use 出品,六个原始 API 给 LLM 完整 Mac 控制权,无框架、无模板、无工具预置](https://blog.mushroom.cv/blog/browser-use-macos-harness-mac-desktop-agent-six-primitives/): macOS Harness 是 Browser Use 团队(主仓库 110k Star)开源的最薄 Mac 桌面 Agent 框架。核心设计:不预置任何应用专属工具,给 LLM 六个原始 API(see/key/type/click/ax/script),让 Agent 在任务执行过程中自行编写缺失的逻辑。一个 Python 进程直接连接 macOS 原生层(CGWindow/CGEvent/AX/AppleEvents)+ 真实 Chrome(CDP)+ 文件系统。不激活、不聚焦目标窗口,不移动物理鼠标。772 Star,MIT,2026-08-17 发布。 - [Disk Analyzer:原生 SwiftUI 磁盘分析工具,交互式旭日图 + 中英双语,无遥测,开源免费](https://blog.mushroom.cv/blog/disk-analyzer-macos-native-sunburst-swift-bilingual/): daniel-weih/disk-analyzer 是一款原生 macOS 磁盘空间分析工具,基于 SwiftUI 开发,核心是多级交互式旭日图(双击下钻)。区分「已分配磁盘空间」和「文件逻辑大小」,处理稀疏文件和硬链接不会造成误导性统计。中英文界面在应用内一键切换并记忆设置。无网络请求、无遥测、无账号。支持 Apple Silicon,MIT 开源,v2.2.0 提供预构建 DMG。 - [GLM-5.3-Flash(Ox Alpha)开源:321B MoE 原生多模态,30T token 预训练,稀疏+线性注意力混合架构,MIT](https://blog.mushroom.cv/blog/glm-5-3-flash-ox-alpha-320b-native-multimodal-open-source/): 2026-08-26 晚,智谱 z.ai 开源 GLM-5.3-Flash(代号 Ox Alpha)。约 321B 参数、激活 18B 的 MoE 模型,GLM-5 系列首个原生多模态版本,原生支持文字、图片、视频处理,使用 30T 多模态 token 预训练。架构上首次引入稀疏注意力与线性注意力混合(DSA),并配套异步强化学习训练基础设施。权重已上传 HuggingFace(zai-org/GLM-5.3-Flash),MIT 开源,FP8 原生支持。unsloth GGUF 量化版已有 172 likes,社区已在 DGX Spark、Mac Studio M3 Ultra、RTX PRO 6000 Blackwell 等平台完成部署。 - [MoeMail:可爱的临时邮箱服务,NextJS + Cloudflare 免费自托管,自带 MCP Server 和 Agent CLI](https://blog.mushroom.cv/blog/moemail-nextjs-cloudflare-temp-email-mcp-cli-agent-first/): MoeMail 是一个基于 NextJS + Cloudflare 全家桶(Pages + D1 + Email Workers + KV)构建的开源临时邮箱服务,免费自托管零成本。特色功能:RBAC 角色权限系统(皇帝/公爵/骑士/平民)、Resend 收发邮件、Webhook 推送、OpenAPI + API Key、Agent-first CLI(@moemail/cli)、MCP Server(@moemail/mcp,支持 Claude Desktop / Cursor / Cline)。2024-12 上线,2,799 Star,2,572 Fork,MIT 开源。 - [Monaco:8500 万融资,40 人团队,AI + 人类销售专家帮初创公司三个月签单 1800 万](https://blog.mushroom.cv/blog/monaco-ai-sales-platform-startup-revenue-engine-series-b-85m/): Monaco 是一个端到端 AI 销售平台,定位为种子轮到 A 轮初创公司的「第一台收入引擎」。核心产品:AI 原生 CRM + 专有潜客数据库 + AI Agent 主导外联 + 人类销售专家实时督导。创始人 Sam Blond 曾任 Brex CRO、Founders Fund 合伙人;Stripe 创始人、YC CEO Garry Tan 等人跟投。2026 年 2 月上线,5 月 ARR 已达约 300 万美元,总融资超 8500 万美元,Benchmark 领投 B 轮。 - [dsh-web:DeepSeek Harness 的插件生态包,任务看板 + SSH + 移动端 + 图像理解三步装齐](https://blog.mushroom.cv/blog/dsh-web-deepseek-harness-web-plugin-sidebar-all-in-one/): dsh-web 是 DeepSeek Harness(DSH)Web GUI 的插件聚合生态包,一条命令装齐任务看板、移动端远程、SSH 运维、图像理解、皮肤、Git 图谱、梁神模式、救助模式等全部能力。一切皆插件,可插拔可替换,附创意工坊(dsh-market.com)社区分发体系。6,000+ Star,Apache 2.0。 - [ECC:24万+ Star 的 Agent 工具箱,Claude Code / Codex 的工程操作系统](https://blog.mushroom.cv/blog/ecc-tools-agent-harness-286-skills-68-agents-claude-code/): ECC(Engineer Claude Code)是目前 GitHub 全球 Star 增速最快的 AI 编程工具仓库,累计 24.3 万 Star。它不是一个模型或 IDE,而是一套安装在 Claude Code / Codex / Cursor / OpenCode 之上的工程纪律层:286 个技能、68 个专项 Agent、94 个命令、AgentShield 安全扫描,MIT 开源。 - [SmolVM:给 AI Agent 配一台一次性虚拟机,毫秒级启动、硬件级隔离](https://blog.mushroom.cv/blog/smolvm-ai-agent-sandbox-vm-firecracker-browser-claude-codex/): SmolVM 是开源的 AI Agent 沙箱基础设施,统一封装 Firecracker、QEMU、libkrun 三种 VMM,让 Agent 在 ~500ms 内获得一台独立虚拟机。支持硬件级隔离、网络出口白名单、浏览器沙箱(CDP + VNC)、主机目录挂载、快照、以及一键启动预装 Claude Code / Codex / Pi 的编程 Agent 环境。785 Star,Apache 2.0。 - [Unlazy:用 Depth Tree + 可运行验证门,卡住 AI 代理「谎报完成」](https://blog.mushroom.cv/blog/unlazy-depth-tree-anti-laziness-gate-contract-claude-code/): Unlazy 是一个 Claude Code / Codex 技能包,用 Depth Tree 方法将任务拆成 N 层,每个叶节点都获得整个任务的完整时间预算——努力程度随深度倍增。核心是可运行验证门(GATES.md),只有所有 CHECK 通过、EVIDENCE 记录在案,才允许报告完成。2,300+ Star,创建于 2026-08-09。 - [Munder Difflin:本地优先多 Agent Harness,把 Claude Code / Codex / Grok 包成一群克隆员工](https://blog.mushroom.cv/blog/munder-difflin-multi-agent-harness-claude-codex-local-first/): Munder Difflin(MIT,3888 stars,Electron+React+TypeScript)是一个本地多 Agent Harness 桌面应用,把 Claude Code、OpenAI Codex、xAI Grok、Kimi Code、Qwen、GitHub Copilot CLI 等 12 种 CLI 包成真实 PTY 进程,用像素风 The Office 场景可视化——每个 Agent 是一个在办公室走动的角色,邮件在桌间飞来飞去。GOD Agent(Michael)负责任务路由和协调,你只和 Michael 说话,Michael 调度整个 Agent 舰队。本地优先,支持 BYOK 和 Ollama 本地模型,含快速语义记忆层、Kanban 任务板、内置 Monaco IDE、Slack 集成和 Agent 图库。 - [SenseNova U1.5:看图、生图、改图,一个模型全搞定](https://blog.mushroom.cv/blog/sensenova-u15-unified-image-understand-generate-edit-mot/): 商汤 SenseNova-U1.5-8B-MoT 把图像理解、图像生成、图像编辑三项能力统一进同一个 8B 参数模型,基于自研 NEO-unify 架构与 MoT(Mixture of Tokens)范式,在不增加推理开销的前提下原生支持 4K 输出,Apache 2.0 开源,GitHub 5.4k Star。 - [treg:Agent 工具的 OpenRouter,一个入口调用 2850+ 个真实世界 API](https://blog.mushroom.cv/blog/treg-openrouter-agent-tools-unified-api-credential-proxy/): Superdesign 团队开源 treg——「OpenRouter for Agent Tools」。一个 token、一个入口,访问约 57 家数据服务商的 2850+ 个接口,覆盖 SEO 外链、社交趋势、人员/公司信息、广告、抓取等。按次计费(最低几分钱),无需注册供应商账号。同时支持团队自有 API Key 共享,让所有人的 Agent 都能使用同一套已有能力,而无需把密钥交出去。Apache 2.0,可自托管。 - [FireRedTTS3:24 语言 + 21 种中文方言零样本声音克隆,指令控制变声和语音编辑](https://blog.mushroom.cv/blog/fireredtts3-multilingual-dialect-voice-cloning-instruction-design/): FireRedTTS3(FireRedTeam,Apache 2.0,Python,183 stars)是基于语义增强连续语音表示的统一语音生成与编辑系统,支持 24 种语言和 21 种中文方言的零样本声音克隆,以及用自然语言描述设计全新声音、语义编辑(插入/删除/替换)和声学编辑(语速/音调/音量)。在 Seed-TTS-eval 上综合 WER/SIM 领先所有开源对手,2026-08-13 发布。 - [ai-memory:让 AI 编程助手真正记住「上次做到哪了」,跨工具无缝交接,Rust 实现,Wiki 存 Git](https://blog.mushroom.cv/blog/ai-memory-long-term-memory-coding-agents-claude-codex-handoff-rust/): akitaonrails/ai-memory 是一个 Rust 实现的 AI 编程助手长期记忆方案,3953 stars,MIT 许可证。核心能力:用生命周期 Hook 自动捕获每次 Claude Code/Codex/Cursor 等会话的精华,会话结束时编译为结构化 Wiki 页面存入 Git 仓库(纯 Markdown,可 grep、可 Obsidian 同步);下次无论用哪个工具打开同一目录,都能收到「上次做到哪里」的交接块。支持 Claude Code、Codex、Command Code、Cursor、Gemini CLI、Devin CLI、Kiro CLI、Kimi Code 等 20+ 客户端;零 LLM 模式可用(FTS5+实体匹配);本地或 homelab 服务器均可运行。 - [Archestra:企业级一体化 AI 平台,MCP 网关 + LLM 代理 + 双 LLM 护栏 + K8s 编排,AGPL 开源](https://blog.mushroom.cv/blog/archestra-enterprise-ai-platform-mcp-gateway-guardrails-llm-proxy-k8s/): archestra-ai/archestra 是一个企业级一体化 AI 平台,4201 stars,TypeScript,AGPL 3.0(30人以下团队免费)。一个 URL、一个 Token,涵盖:LLM 网关(Anthropic/OpenAI/Azure/Bedrock/DeepSeek,带费用限额和虚拟 API Key)、MCP 网关(OAuth + On-Behalf-Of,工具以用户身份运行)、A2A 网关、私有 MCP 注册表、K8s MCP 编排器、Agent 运行时(定时/邮件/Webhook 触发、子 Agent 委托、沙箱代码执行)、RAG 知识库、双 LLM 护栏 + Lethal Trifecta 防护、SSO(OIDC/SAML/Okta/Entra)+RBAC、OpenTelemetry traces + Prometheus metrics。已融资 $13.5M,三个 Fortune-50 部署,p95 延迟 31ms,已加入 Linux Foundation / CNCF。 - [Block 开源桌面 Agent 工作台 Berd:不造新 Agent,把你手里所有 Agent 收编进同一个桌面](https://blog.mushroom.cv/blog/berd-block-square-desktop-agent-workbench-tauri-goose-acp-open-source/): block/berd 是 Square 母公司 Block 开源的桌面 Agent 工作台,Tauri 2 + React 19,Apache 2.0,691 stars。核心定位:不是再造一个更强的 Agent,而是把现有 Agent 统一进一个桌面界面——通过 ACP WebSocket 连接 Goose 后端,支持任意模型,内置企业发布通道分离机制(公开源码 + 私有覆盖层),可发布可移植 Agent Skill,第一个官方 Skill 是 buzz-handoff(Buzz 频道上下文导入私有 Agent 对话)。 - [M5Stack StopWatch 变成 Codex 物理控制器:BLE 麦克风 + 额度仪表盘 + 四向 Agent 触摸,vibe coding 专属硬件](https://blog.mushroom.cv/blog/codex-micro-stopwatch-m5stack-ble-hid-quota-dashboard-macos/): liptoxli/M5stopwatch-vibecoding 把 M5Stack StopWatch(ESP32-S3)改造成 Codex 专属物理控制器,MIT,C 语言固件。固件 v0.10.1 / macOS Bridge v1.3.1。核心能力:16 kHz IMA-ADPCM 实时 BLE 音频流变成 macOS 虚拟麦克风 M5 StopWatch Mic(不生成 WAV 文件);BLE HID 实体按键控制语音输入;原生 Codex Micro BLE HID 兼容层(四 Agent 槽位/推理等级 Encoder/四向 Radial 输入);466×466 圆形 AMOLED 显示 Codex 周额度、当天用量、四小时活动热力图和 Agent 状态;两套 UI(Classic/Pet 和 OpenWatcher V2);约 5 小时续航(实测 4h33m)。 - [cove-book-forge-mcp:把 PDF/EPUB 书籍锻造成 Agent Skill,一次分析,Codex/Claude Code 永久复用](https://blog.mushroom.cv/blog/cove-book-forge-mcp-pdf-epub-agent-skill-obsidian-codex-claude/): moonlin1213/cove-book-forge-mcp 是一个本地优先的开源 MCP 服务器,把 PDF 或 EPUB 书籍转化为可复用的 AI 知识——稳定指纹缓存章节分析,同一份结果同时输出 Obsidian 笔记和可安装的 Agent Skill(兼容 Codex、Claude Code)。支持 OpenAI/DeepSeek/Anthropic 三类 Provider,完整书籍锻造作业可暂停/恢复,所有输入严格边界检查,MIT,Python。 - [DeepTutor:终身个性化 AI 家教,真正记住你学到哪了,多 RAG 引擎+长期记忆+Skills 生态,Docker 自托管](https://blog.mushroom.cv/blog/deeptutor-lifelong-personalized-ai-tutoring-rag-skills-memory-docker/): HKUDS/DeepTutor 是香港大学数据科学团队开源的终身个性化 AI 学习工作台,36949 stars,Apache 2.0,Python + Next.js。核心差异:三层长期记忆(L1 轨迹/L2 摘要/L3 综合)真正追踪每个学习者的进度;Chat/Quiz/Research/Visualize/Solve/Mastery Path/沉浸阅读七种模式共用同一个 Agent 循环;多引擎知识库(LlamaIndex/PageIndex/GraphRAG/LightRAG/Obsidian/MarginNote 4);Skills 社区生态(EduHub/ClawHub);Partners 系统(Claude Code/Codex/Gemini/Kimi 等 15 个 IM 渠道);v1.5.16 今日更新;pip 一键安装或 Docker 自托管。 - [Drawnix:开源一体化白板,思维导图+流程图+自由画,Plait 插件架构,14K stars](https://blog.mushroom.cv/blog/drawnix-open-source-whiteboard-mind-map-flowchart-plugin-architecture/): plait-board/drawnix 是 PingCode 开源的一体化白板工具,14580 stars,MIT 协议,TypeScript,基于自研 Plait 画图框架和插件架构。功能覆盖思维导图、流程图、自由画(含橡皮擦)、无限画布;支持 Markdown 转思维导图、mermaid 转流程图;导出 PNG/SVG/JSON,复制到剪贴板;多语言(中/英/俄/阿拉伯/越南);移动端适配;Docker 部署;自动保存。v0.4.0 新增 SVG 导出、激光笔、自由画预设颜色。 - [读《What is a Harness?》:Model 负责聪明,Harness 负责让这份聪明变成「能干活」](https://blog.mushroom.cv/blog/earendil-what-is-a-harness-pi-minimal-agent-four-primitives/): Earendil 团队写了一篇极简博客《What is a Harness?》,用攀岩 Harness 的比喻把 Agent Harness 压缩成四件事:System Prompt(工作说明)、Tools(手和脚)、Agentic Loop(根据上一步结果决定下一步的能力)、Translation Layer(换模型不换工作流)。这篇文章是读后感,试图把这个比喻推到底,然后说说为什么 Pi 把「极简」当成第一原则,而不是功能完备。 - [FreeToken:游戏 PC 本地跑 290B+ MoE 大模型,q* 自适应执行引擎,开源 Apache 2.0](https://blog.mushroom.cv/blog/freetoken-flashml-edge-moe-290b-gaming-pc-deepseek-local-inference/): FlashML-org/FreeToken 是一个边缘原生 MoE 推理引擎,Apache 2.0,Python,2105 stars。核心:在消费级 GPU(RTX 30/40/50)上本地运行 290B+ MoE 模型(DeepSeek-V4-Flash、Qwen3.6-35B、GLM-5.2),通过 q* 带宽自适应 CPU-GPU 协同执行、双缓冲预填充流、全局 LRU Expert 缓存、语义感知 KV 缓存实现交互级速度。兼容 Anthropic/OpenAI API,可直接接入 Claude Code、Codex、OpenCode。来自 Berkeley/MIT 研究团队(Matei Zaharia、Song Han、Kurt Keutzer、Ion Stoica),有 arXiv 论文。 - [GameFactory-3A:让编程 Agent 直接生成 3A 游戏资产,UE5/Blender/Unity/three.js 全支持,Apache 2.0 开源](https://blog.mushroom.cv/blog/gamefactory-3a-open-source-coding-agent-game-generation-ue5-blender-unity/): OpenDCAI/GameFactory-3A 是一个开源的 3A 游戏生成 Skill 和资产框架,Apache 2.0,Python,256 stars。核心思路:把 Claude Code、Codex、Gemini CLI 等编程 Agent 接入一套结构化的 Skill 体系,Agent 读 agent_skills/setting_overview.md 后,自动调用图像生成、3D 对象/场景、动作捕捉、音频、CG 视频、UI/游戏逻辑等完整流水线,产出可直接导入 UE5、Blender、Unity 或 three.js 的引擎就绪代码和资产。项目已有 Unity/UE5/Blender/three.js 四套引擎的游戏 Demo(格斗/FPS/赛车/RPG),CG 视频本地用 MiniMax H3 在 720P 生成。 - [TRELLIS.2:微软图生 3D 续作,O-Voxel 打破拓扑限制,4B 参数,3 秒 512³ 分辨率](https://blog.mushroom.cv/blog/microsoft-trellis2-image-to-3d-o-voxel-pbr-native-compact/): microsoft/TRELLIS.2 是 TRELLIS(CVPR'25 Spotlight)的续作,10745 stars,MIT,Python。核心创新:O-Voxel「无场」稀疏体素结构取代等值面场,天然支持开放表面(衣物/叶片)、非流形几何、内部封闭结构;4B 参数模型 512³ 分辨率 H100 上约 3 秒,1024³ 约 17 秒;完整 PBR 材质(Base Color/Roughness/Metallic/Opacity);网格→O-Voxel <10 秒(单 CPU),O-Voxel→网格 <100ms(CUDA);训练代码完整开源,可从头训练或微调;ComfyUI 封装已有社区版本。 - [Omarchy:DHH 造的 AI 原生 Linux,9 个 Agent 开箱即用,Omacom 基金会 800 万美元背书](https://blog.mushroom.cv/blog/omarchy-dhh-linux-ai-native-os-hyprland-omacom-foundation-arch/): basecamp/omarchy 是 Rails 作者 DHH 打造的 AI 原生 Linux 发行版,基于 Arch + Hyprland + Quickshell,28,045 stars,MIT。核心定位:美观、现代、有主见——预装 9 个 AI 编程 Agent 惰性启动器(Claude Code/Codex/OpenCode/Copilot/Grok/Pi 等),顶栏 Agent 面板统一追踪订阅额度,systemd 崩溃自动交给 Agent 诊断,Agent Skill 跨 Claude Code/Codex/Pi 共享。Omacom Foundation 于 2026 年 8 月宣布以 800 万美元独立资助该项目。 - [OpenToys:ESP32-S3 + Mac,把 AI 语音玩具的推理完全跑在本地,零云端依赖](https://blog.mushroom.cv/blog/opentoys-esp32-mac-local-ai-voice-toy-whisper-qwen3-tts-mlx/): akdeb/OpenToys 是 ElatoAI 的本地优先版本:ESP32-S3 作硬件终端,Apple Silicon Mac 负责全部推理(Whisper Turbo ASR + Qwen3-TTS/Chatterbox + MLX LLM),WebSocket 经由玩具自建 WiFi 热点连接,零云端依赖,MIT 开源,148 stars。桌面端是 Tauri + React + Rust,支持多语言、声音克隆(<10秒音频),可刷入任意 ESP32-S3 设备;WIRED、ArsTechnica、Hackster 均有报道。 - [胜利的大会:本地 AI 会议同事,录音→深度业务纪要→知识库,macOS 首发](https://blog.mushroom.cv/blog/shengli-dahui-victory-meeting-local-ai-meeting-notes-business-knowledge/): 胜利的大会(Victory Meeting)是一款面向业务团队的本地优先 AI 会议纪要工具,v1.0.0-test 首发,仅支持 macOS Apple Silicon。核心流程:录音或上传音频 → 本地转写 → 生成深度业务纪要(结论/重点/行动项/风险)→ 提取待办事项 → 候选知识发现 → 人工确认后入库。适合渠道、销售、市场、代理商沟通等业务场景;知识库支持客户、产品、渠道、项目、竞品、方法论等长期沉淀;支持 Obsidian 知识库集成;本地优先,API Key 不硬编码,AI 接口只在生成纪要时调用。 - [AI 协作实战手册:一位在读博士的科研、写作、编码工作流——人是主变量](https://blog.mushroom.cv/blog/ai-collab-playbook-phd-workflow-skills-context-first/): cnfjlhj/ai-collab-playbook 是一位 AI 方向在读博士积累的 AI 协作实战手册,433 stars。核心观点:把 AI 当同事不当工具,但人始终是主变量。涵盖科研文献四阶段工作流(调研→筛选→精读→整合)、低摩擦入口策略、Code Agent 使用心得、上下文税与心流状态、技能沉淀到 Skill/AGENTS.md 的闭环,以及对「效率幻觉」的警惕。附 10 个独立 Skill 仓库。 - [Blender MCP:用自然语言控制 Blender 3D,接任意 LLM,26K stars 社区插件](https://blog.mushroom.cv/blog/blender-mcp-control-blender-3d-any-llm-mcp-claude-code/): ahujasid/blender-mcp 是把 Blender 3D 接入任意 LLM 的社区 MCP 插件,26K stars,MIT 协议。三步安装:安装 uv → 配置 MCP 服务器 → 安装 Blender 插件。能力:自然语言创建/修改/删除 3D 对象、材质控制、场景信息获取、在 Blender 里直接执行 Python 代码、从 Poly Haven 下载资产和 HDRI、从 Sketchfab 搜索模型、通过 Hyper3D Rodin 和 Hunyuan3D 生成 AI 3D 模型。支持 Claude Desktop/Code、Cursor、VS Code、OpenCode。两部件:Blender 插件(socket 服务器)+ MCP Server(TCP 桥接),JSON 协议通信。 - [MOSS-Transcribe-Diarize 0.9B:端到端多说话人转写+说话人分离,一个模型搞定,INTERSPEECH 2026 冠军](https://blog.mushroom.cv/blog/moss-transcribe-diarize-end-to-end-multi-speaker-asr-diarization-sota/): OpenMOSS 开源的 MOSS-Transcribe-Diarize 0.9B(1.5K stars),SOTA 端到端音频理解模型,一个模型同时完成长音频多说话人转写、说话人分离(diarization)、精确时间戳和声学事件标注。架构:Qwen3-0.6B 解码器 + Whisper-Medium 编码器 + 4x 时序合并 MLP 桥接。支持 50+ 语言。输出格式 [时间戳][S01]文本[时间戳]。在 AISHELL-4/Alimeeting/Podcast/Movies 四个基准上超越 Doubao、ElevenLabs、GPT-4o、Gemini 3 Pro。支持 SGLang Omni / vLLM 推理,H100 单卡 98 audio_s/s。赢得 INTERSPEECH 2026 第二届 MLC-SLM 挑战赛冠军。 - [OpenAI Codex CLI:108K stars 的开源终端编码 Agent,Rust 重写,ChatGPT 账号直接登录](https://blog.mushroom.cv/blog/openai-codex-cli-rust-terminal-coding-agent-chatgpt-open-source/): openai/codex 是 OpenAI 开源(Apache 2.0)的本地终端编码 Agent,108K stars,Rust 实现,16.5K forks。支持 ChatGPT Plus/Pro/Business 账号直连(无需 API Key),四种部署形态(CLI/IDE/桌面应用/云端 Web),内置 Skills 系统、Slash 命令、AGENTS.md 支持、执行策略沙箱。OpenAI 同时设立 100 万美元开源基金,每个项目最高 2.5 万美元 API 额度。背后是 AI 编码 Agent 生态的正面竞争:Claude Code、DeepSeek Harness 之后,OpenAI 用开源回应。 - [Sentence Transformers v6.0:ColBERT 式多向量检索正式收编,第四种模型类型,一行代码接入 RAG](https://blog.mushroom.cv/blog/sentence-transformers-v6-colbert-multi-vector-late-interaction-rag/): Sentence Transformers v6.0(2026-08-18)新增 MultiVectorEncoder 作为第四种模型类型,把 ColBERT 式「每 token 一个向量 + MaxSim 打分」的晚交互检索收编进统一 API。支持加载 PyLate / Stanford-NLP ColBERT / ColPali 所有历史检查点;同 backbone 相比稠密模型 NanoBEIR 平均高约 1 个 NDCG 点;索引大 42x 但 fast-plaid 压缩后约 88MB;HierarchicalTokenPooling 可在几乎零质量损失下把向量数量减半;视觉文档检索(文字查图片页面,无需 OCR)同一 API 直接支持。也是 Qdrant / Weaviate / Vespa / Milvus 原生 MaxSim 的统一入口。 - [Swift Qwen3 TTS:五种压缩技术让模型从 2.35 GB 缩到 808 MB,Apple Silicon 本地实时语音合成](https://blog.mushroom.cv/blog/swift-qwen3-tts-apple-silicon-compression-token-map-indirection/): AtomGradient 发布的 Qwen3 TTS 端侧压缩论文与工程实现。五种正交压缩技术(词汇剪枝 + ST 编码器剥离 + FP16 转换 + 4-bit 量化 + MLP 神经元/层剪枝)将 Qwen3 TTS 0.6B 从 2.35 GB 压缩到 808 MB(减少 67%),峰值内存从 5.14 GB 降到 2.13 GB,Apple Silicon 上实现 0.68x 实时因子。核心创新:Token Map Indirection 把 1.51 万词的文本嵌入矩阵从 622 MB 压到 194 MB 且完全无损。完整推理引擎用 Swift + MLX 实现,无 Python 依赖。 - [Unsloth Desktop 正式发布:一个 App 搞定本地运行、训练、部署,直连 Claude Code 和 MCP](https://blog.mushroom.cv/blog/unsloth-desktop-local-run-train-ai-claude-code-mcp-finetuning/): unslothai/unsloth 发布首个桌面应用 Unsloth Desktop(v0.1.801-beta),74K stars。一个 App 集成本地大模型运行(LLM/扩散/音频/嵌入)、微调训练(LoRA/QLoRA/GRPO/DPO,2x 提速,省 70% 显存)、Claude Code/Codex/MCP 接入(一条命令 unsloth start claude)、私有 Web 搜索、RAG、图像/视频生成、Data Recipes 数据集构建、OpenAI 兼容 API 服务。支持 CPU/Apple Silicon/NVIDIA/AMD/Intel/多 GPU,Cloudflare HTTPS 远程访问。导出 GGUF/NVFP4/FP8 格式。 - [Wake:macOS 原生 Agent 会话管理器,Rust + GPUI,把 Claude Code/Codex/13 个 Agent 的历史汇聚一处](https://blog.mushroom.cv/blog/wake-gpui-coding-agent-session-browser-claude-codex-macos-native/): iAmCorey/Wake 是 macOS 原生 Agent 会话浏览器,387 stars,MIT,Rust + GPUI(gpui 0.2 + gpui-component 0.5),2026-08-18 发布。读取 13 个 Agent 的本地会话数据(Claude Code、Codex CLI、OpenCode、Kiro、Gemini CLI、Grok Build 等),统一浏览/全文搜索/一键恢复。SQLite FTS5 三元组索引,CJK + 代码子串搜索均在 1ms 内返回。tree-sitter 代码高亮(30+ 语言)、工具调用折叠、Thinking 摘要。所有操作只读,零网络请求,数据完全本地。 - [FastVideo:视频生成加速框架,稀疏蒸馏 >50x + FastMetal 支持 Apple Silicon 本地推理](https://blog.mushroom.cv/blog/fastvideo-hao-ai-lab-video-generation-distillation-sparse-attention-apple-silicon/): FastVideo 是 hao-ai-lab 开源(Apache 2.0)的统一视频生成后训练与实时推理框架,4K stars。核心技术:Video Sparse Attention(VSA)+ Sparse Distillation 实现 >50x 去噪加速,DMD2 步进蒸馏,Self-Forcing 因果蒸馏;最新 FastWan-QAD 5 秒视频端到端 1.8 秒生成,FastMetal-QAD 支持 Apple Silicon MLX 本地推理(1.3B/5B/14B);Dreamverse 实时视频生成与「vibe directing」编辑平台;SGLang 扩散推理基于 FastVideo fork。 - [Flowix:Markdown 笔记本变成 AI Agent 的持久记忆,MCP 直连 Claude Code / Codex / Hermes](https://blog.mushroom.cv/blog/flowix-markdown-notebook-agent-memory-mcp-claude-code-codex/): Flowix 是一个开源(MIT)的本地优先桌面 Markdown 笔记本,329 stars,基于 Tauri 2 + TypeScript + Rust。核心定位:把用户的笔记变成 AI Agent 的持久上下文。内置 flowix-cli MCP server,Codex、Claude Code、OpenCode、Hermes 等工具通过 MCP 或 CLI 直接读写同一份笔记;附带 dsh-flowix-memory 插件接入 DeepSeek Harness;所有数据本地 Markdown 文件存储,用户控制 Agent 可见范围。 - [HarnessRouter:单容器自托管多 AI 编码 Agent,UHP 统一协议让 Claude Code / Codex / Hermes 共用一套 API](https://blog.mushroom.cv/blog/harnessrouter-uhp-unified-agent-protocol-self-hosted-codex-claude-code/): HarnessRouter 社区版是一个开源(Apache 2.0)的自托管 Agent 调度平台,单 Docker 容器运行,内置 Claude Code、Codex、Hermes 三套 Agent harness,通过 UHP(统一 Harness 协议)统一 API,所有数据本地留存,无遥测,无账号,适合私有化部署、产品内嵌 AI 编码能力和多 Agent 对比评测。Starter Kit 提供 Slides / Sheets / Dashboards / Videos 四个开箱即用产品。 - [Qwen3.8-27B-Uncensored-MLX:消融对齐的混合线性注意力视觉语言模型,2/4/6/8-bit Apple Silicon 本地运行](https://blog.mushroom.cv/blog/qwen3-8-27b-uncensored-mlx-abliterated-gated-deltanet-vision/): OrcaRouter 发布的 Qwen3.8-27B 消融对齐(abliterated)MLX 量化版本,672 likes,trending。基于 Qwen3.8-27B —— 一个 64 层混合架构模型(48 层 Gated DeltaNet 线性注意力 + 每 4 层一个全注意力层),原生视觉语言塔,262K 上下文,MTP 头。提供 2/4/6/8-bit 四个精度(affine 量化,group size 64),视觉塔保持 BF16。4-bit 在 32GB Mac 运行,8-bit 需 64GB。专为 AI 安全研究、拒绝机制研究、red-teaming 设计。 - [Sprite Studio:本地优先 AI 2D 游戏美术工作台,Rust 骨骼引擎确定性渲染 + Codex 驱动逐帧动画](https://blog.mushroom.cv/blog/sprite-maker-sprite-studio-ai-2d-game-art-tauri-rig-animation/): Sprite Studio 是一个开源(MIT)的本地优先 AI 2D 游戏美术桌面工作台,基于 Tauri 2 + Svelte + Rust + SQLite + Codex CLI。支持聊天生成精灵、AI 逐帧动画(身份参考 + 邻帧参考保证风格连贯)、原生 Rust 骨骼绑定引擎(关节点 + 胶囊骨骼 + IK + 确定性像素渲染,无需图像生成)、以及 PNG 精灵表导出。覆盖 macOS、Windows、Linux,内置 8 个工作区标签页。 - [Agent Skills 标准调研:今天写的好几个项目背后,都是同一份规范](https://blog.mushroom.cv/blog/agent-skills-open-standard-progressive-disclosure-anthropic/): 调研 Agent Skills 开放标准:一个 SKILL.md 文件(含 name/description 元数据+指令)加可选的脚本/参考文档/模板,就是一个可移植、可跨产品复用的技能包。核心机制是三阶段渐进式披露——发现阶段只加载名字和描述、激活阶段任务匹配才读全文、执行阶段才按需跑脚本或加载引用文件,让 Agent 能同时挂载大量技能而不撑爆上下文。由 Anthropic 原创发布为开放标准,本文同一批写的 Hermes Agent、Nerve、Humanizer 都兼容或依赖这份规范。Apache-2.0(代码)+ CC-BY-4.0(文档),24374 star。 - [awesome-rsi:AI 递归自我改进资源精选库——从哥德尔机到 2026 年自我修改 Agent 的完整图谱](https://blog.mushroom.cv/blog/awesome-rsi-recursive-self-improvement-curated-survey-godel-agents-benchmarks/): pinkbubblebubble/awesome-rsi 是一个高信噪比的递归自我改进(RSI)资源精选库,覆盖理论基础、自我修改 Agent、评估基准和安全研究。关键洞察:RSI 比普通迭代更强——系统必须改进那个产生后续改进的机制本身,而不只是修改一次答案。2026 年已有 MOSS、Ouroboros、Red Queen Gödel Machine 等系统达到真正 RSI 级别。 - [Dense-Mem 调研:AI 记忆不该是「想存就存」,而该有证据链和权限](https://blog.mushroom.cv/blog/dense-mem-governed-ai-memory-mcp-evidence-provenance/): 调研自托管 MCP 记忆服务 Dense-Mem:核心理念是「受治理的 AI 记忆」,模型写入的是一份「提案」,真正能不能变成持久状态由服务端的确定性策略和封闭 schema 校验决定;证据精确、持久、只增不删,生命周期变更只改变有效状态,从不抹除溯源链;关系只有在证据支持「合格」时才成为活跃的图边,未决的候选和假设默认不会被召回。Go 1.26 + PostgreSQL/pgvector 做持久权威,Redis 只做协调。Apache-2.0,36 star,配套研究预印本。 - [Hermes Agent 调研:不是套壳,是一整套会自我进化的 Agent 运行时](https://blog.mushroom.cv/blog/hermes-agent-nous-research-self-improving-skill-loop/): 调研 Nous Research 开源的 Hermes Agent:MIT 协议、23 万+ star。核心卖点是「闭环学习」——从任务经验里自动生成技能、技能在使用中自我改进、周期性提醒自己沉淀记忆、跨会话检索过往对话。内置 cron 调度支持自然语言定时任务无人值守运行,7 种终端后端支持从 5 美元 VPS 到 Serverless 休眠唤醒,跨 Telegram/Discord/Slack/WhatsApp/Signal 单网关接入。本文从两条小红书线索一路查到这个一手项目,并与本站已覆盖的 Kiro Crew、LoopX 做了角色区分。 - [Humanizer 调研:把维基百科「AI 写作特征」清单变成一个能装进任何 Agent 的 Skill](https://blog.mushroom.cv/blog/humanizer-skill-ai-writing-patterns-wikipedia-cleanup/): 调研开源 Skill 项目 Humanizer:一份纯 Markdown 的技能文件,任何支持 Skill 的 Agent(Claude Code 等)都能装。不发明事实,只改文风——依据维基百科 WikiProject AI Cleanup 维护的「AI 写作特征」清单,覆盖 35 种模式(夸大重要性、堆砌形容词、强行三件套、破折号泛滥、加粗小标题、表情符号等),先起草改写、再检查残留AI腔和被篡改的事实、最后定稿。支持用一段你自己的文字样本做「语气匹配」。MIT,36120 star。 - [Ling-3.0-Tiny:7.9B 总参数激活仅 1.3B,蚂蚁百灵把混合推理 MoE 推进了端侧](https://blog.mushroom.cv/blog/ling-3-0-tiny-ant-7b-moe-edge-device-mla-kda/): 蚂蚁百灵(Ling-Ant)开源轻量混合推理 MoE 模型 Ling-3.0-Tiny:总参数 7.9B、激活仅 1.3B,KDA 与 MLA 3:1 交替结构配合 128 专家稀疏 MoE,提供 BF16/FP8/INT4 三个精度版本。FP8 精度下 MacBook 上输出速度 86-90 tokens/s,8K 上下文峰值内存仅 8.34GiB。在智能指数评测获 25 分(比 Gemma-4-26B 低 1 分),Agent 得分超越 31B 级别模型。数据全程本地留存,适合隐私敏感场景的端侧 Agent 部署。 - [llmconfig:一份 YAML 统一管好 llama.cpp / stable-diffusion.cpp / whisper.cpp](https://blog.mushroom.cv/blog/llmconfig-local-inference-yaml-llama-cpp-whisper-cpp/): 调研本地推理配置工具 llmconfig:一份 YAML + 一个 CLI,统一管理文本(llama.cpp)、图像(stable-diffusion.cpp)、语音(whisper.cpp)三套本地推理后端的下载/启动/停止/重启/监控。硬件感知,NVIDIA/Apple Silicon/AMD/Intel GPU/CPU 运行时自动选配置。跑起来的模型是 OpenAI API 的直接替代品,可选 gateway 命令把所有正在跑的模型统一暴露在一个端口。免编译,二进制直接下载,19 个内置模板。Go 写的,MIT,23 star,小而专注。 - [Maka 调研:把「日志」当成 Agent 运行时的唯一真相源](https://blog.mushroom.cv/blog/maka-agent-runtime-host-event-log-desktop-tui-eval/): 调研本地优先 Agent 工作台 Maka:核心设计是「Log is the Runtime」——模型消息、工具调用、工具结果、终止事实全部进 Runtime Event Log,会话、UI、模型上下文、崩溃恢复都是这份日志的投影,而不是各自维护一份状态。Desktop(Electron+React)、TUI/CLI、Eval 基准测试三种入口共用同一个 Runtime Host,执行语义完全一致。Apache-2.0,1374 star,macOS Apple Silicon 早期公开版。 - [从零读懂 nano-vLLM:13 章源码教程 + 13 个浏览器实验,拆解推理引擎核心机制](https://blog.mushroom.cv/blog/nano-vllm-interactive-guide-scheduler-kvcache-cuda-graph-tutorial/): nano-vllm-interactive-guide 是一个面向开发者的交互式源码学习项目,基于 GeeeekExplorer/nano-vllm(约 1200 行 Python)。13 章中文教程 + 13 个纯 HTML 浏览器实验 + 每章课后习题,从一次 generate() 调用出发,逐步拆解 Scheduler、PagedAttention 分页 KV Cache、Prefix Cache、Prefill/Decode 分离、FlashAttention、Tensor Parallel 和 CUDA Graph。无需 GPU 即可在浏览器体验核心机制。 - [Neo Chat:本地优先的 AI 聊天工作台,把「加密跨设备同步」这个硬骨头啃下来了](https://blog.mushroom.cv/blog/neo-chat-local-first-encrypted-sync-mcp-rag-workspace/): 调研开源项目 Neo Chat:Next.js 16 + React 19 构建的本地优先 AI 聊天工作台,聊天记录/技能/插件配置/记忆/搜索索引/文件默认全部留在浏览器本地,服务端只做受控代理。v2.4.0 新增可选端到端加密的个人保险库,通过 WebDAV 或 S3/MinIO 做跨设备同步,恢复密钥、凭据、本地基线、搜索缓存、向量都不会进远程对象或 ZIP。同时支持多模型供应商、远程 MCP 服务器发现安装、本地 stdio 桥接、参数化 Skill、混合词法/向量 RAG 检索。MIT,1774 star。 - [ClickHouse 官方出品 Nerve:基于 Claude Agent SDK 的自托管 Agent 运行时](https://blog.mushroom.cv/blog/nerve-clickhouse-self-hosted-claude-agent-sdk-runtime/): 调研 ClickHouse 官方开源的 Nerve:基于 Claude Agent SDK 的自托管 Agent 运行时,单进程零运维(能跑在树莓派上),双层记忆(热记忆+语义深记忆),Skill 自我提炼与修订,Gmail/GitHub/Telegram 统一收件箱。个人模式(Personal)养成有个性的生活助手,Worker 模式给一句英文任务描述就自配置成专职工作 Agent。可直接用 Claude Max/Pro 订阅,不需要额外 API Key。Apache-2.0,72 star,早期但值得关注。 - [Omni 调研:企业级开源 Agent,权限跟着数据走,不是搜到什么就给看什么](https://blog.mushroom.cv/blog/omni-open-source-company-ai-agent-permission-aware/): 调研自托管开源公司级 AI Agent Omni:接入 Google Drive、Gmail、Slack、Confluence、Jira、HubSpot 等企业常用工具,核心设计是「权限感知的公司上下文」——索引信息的可见范围严格继承自源系统的权限,不会因为被索引过就绕开原本的访问控制。混合检索(BM25全文+pgvector语义)全部收在一个 Postgres 里,不需要额外的 Elasticsearch 或专用向量库。沙箱代码执行走隔离 Docker 网络+只读根文件系统+Landlock。Rust+Python+SvelteKit 多语言架构,模型不锁定,Apache-2.0,758 star。 - [PipesHub:开源企业 AI 上下文层——把知识图谱、权限感知 RAG、MCP 工具和 Agent 统一到一个自托管系统](https://blog.mushroom.cv/blog/pipeshub-ai-enterprise-context-layer-knowledge-graph-rag-mcp/): pipeshub-ai/pipeshub-ai 是一个开源的企业 AI 上下文层(Context Layer),把企业内部的知识连接、权限管控、知识图谱检索、50+ 数据源连接器、RAG 问答、Agent 构建、MCP 工具、代码执行沙箱统一到一个自托管系统。支持任意 LLM、部署在自己的 VPC 内、数据不出境,同时提供精确块级引用和来源溯源能力。Docker Compose 一键安装。 - [Polaris:浙大 REAL 实验室开源端到端 AI 科研智能体——从文献调研到论文投稿六阶段全自动](https://blog.mushroom.cv/blog/polaris-zju-real-end-to-end-ai-research-agent-voyage-pipeline/): ZJU-REAL/Polaris 是浙江大学 REAL 实验室开源的端到端 AI 科研平台,六阶段流水线:文献调研 Wiki → 想法生成 → Elo 辩论评审 → GPU 实验执行 → LaTeX 论文写作 → 引用核验。核心设计是确定性代码做繁重工作、LLM 只做判断,Voyage 任务可跨天持久化续跑并设人工审批门禁,Navigator/Helm/Sextant 三引擎驱动,MCP 工具层对外开放,Docker Compose 部署。 - [AI-Infra-Guard:腾讯朱雀实验室的 AI 红队平台——MCP 扫描、Skill 审计、2000+ CVE 规则一体化](https://blog.mushroom.cv/blog/tencent-ai-infra-guard-red-team-platform-mcp-skill-vulnerability-scan/): 腾讯朱雀实验室开源的 AI 红队平台 A.I.G(AI-Infra-Guard),整合 AI 基础设施漏洞扫描(2000+ CVE 规则)、MCP Server 安全检测、Agent Skill 审计(SkillTrustBench T01-T09 九类风险)、越狱评估五大能力。v4.5.2 新增 .pyc 字节码绕过检测和 SkillJack 研究,Black Hat EU 2025 Arsenal 展出。Docker Compose 一键部署,Claude Opus 4.6 在 SkillTrustBench 评测中 F1 达 0.9848。 - [pixiv/three-vrm 调研:把「虚拟形象」这件事做成 Web 标准件](https://blog.mushroom.cv/blog/avatar-vrm-threejs-pixiv-three-vrm-mtoon-webgpu/): 深入调研 pixiv 开源的 three-vrm——一个把 VRM 人形化身格式带进 three.js 的库。MIT 授权、2103 star、npm 周下载 79,477、最新 v3.5.5。文章拆解它的 16 包 monorepo 架构、GLTFLoader 插件设计、归一化人形骨骼、MToon 卡通材质与 WebGPU 支持、弹簧骨骼物理、VRMA 动画格式,以及 VRM 0.0 → 1.0 迁移的六个真实坑位。附最小可用代码与性能优化清单。 - [browser-harness:一个会自己写代码的浏览器 Agent 工具——每次运行都在让自己变聪明](https://blog.mushroom.cv/blog/browser-harness-self-healing-cdp-agent-skill-chrome-automation/): browser-use/browser-harness 是一个通过 Chrome DevTools Protocol(CDP)直接控制真实浏览器的 Agent 工具——没有 Selenium、没有 Playwright 包装层,一条 WebSocket 到底。Agent 遇到不会的操作,就地写 helper 函数,下次复用;遇到特定网站的操作,自动生成 domain skill 文件并归档。核心代码约 1000 行,4 个核心文件。是 Claude Code、Codex、Cursor 等 Agent 的「浏览器能力插件」。 - [读 cordiverse/paper:为什么「可逆副作用」是插件系统最难的问题,以及它对 AI Agent 自我净化意味着什么](https://blog.mushroom.cv/blog/cordiverse-cordis-spatiotemporal-composability-plugin-paradigm-paper/): cordiverse/paper 是支撑 DeepSeek Harness 底层框架 Cordis 的学术论文草稿(2026-08-13)。论文提出「时空可组合性」编程范式:时间可组合性(Temporal Composability)保证插件卸载时能完全撤销副作用,空间可组合性(Spatial Composability)保证插件之间的依赖关系可以响应式管理。这两个特性合在一起,让 AI Agent 运行时真正实现「热替换」——哪个组件出问题,换掉它,不重启整个系统。从工程角度分析:这正是长程 Agent 自我净化(Self-Purification)的理论基础。 - [dots.tts:2B 全连续自回归 TTS——为什么不用离散 Token,以及这个科研底座能赋能哪些新应用](https://blog.mushroom.cv/blog/dots-tts-2b-continuous-autoregressive-meanflow-voice-clone-zero-shot/): dots.tts 是 dots 团队联合上交大 X-LANCE 实验室开源的全连续端到端自回归 TTS 基座模型(2B 参数)。区别于 VALL-E 等离散 Token 路线,dots.tts 直接在 AudioVAE 压缩的连续隐空间逐块生成波形,语言模型骨干为 Qwen2.5-1.5B-Base,配 AR 流匹配头(MeanFlow)。在 Seed-TTS-Eval 上达到 SOTA。开放 7 个 checkpoint、支持 SGLang Omni、提供 dots.tts.edit 语音编辑能力。本文分析其技术架构,并从科研底座出发,列举 8 个可以在这个基础上赋能的新 Feature。 - [美团图灵 Agent 评测两年实践:当 Agent 评测从打分动作变成工程基础设施](https://blog.mushroom.cv/blog/meituan-agent-evaluation-trajectory-rubric-harness-practice/): 读美团技术博客《Agent评测漫谈》后的分析与延伸。美团图灵评测团队用两年实践提炼出一套工业级 Agent 评测体系:观测是基石、Rubric 二元化、数据飞轮。长程 Agent 时代,评测对象从「模型回答」变成「任务系统执行链路」,评测范式从 Query→Answer 升级到 Prompt→Expected Behavior。文章同时梳理三个可用开源评测框架(pinchbench、claw-eval、WildClawBench)和工程实现路径。 - [H3-Context-IR:MiniMax H3 系统里那个不开源的「意图翻译层」,为什么说它才是真正的创作入口](https://blog.mushroom.cv/blog/minimax-h3-context-ir-prompt-orchestration-multimodal-video/): MiniMax H3 的完整系统由三个模块组成:H3-Context-IR、H3-Base 和 H3-Regenerate-2K。开源的是 H3-Base,但官方强烈建议接入 H3-Context-IR。它是一套「托管式预处理与编排系统」,负责把用户的自然语言创作意图(含图像、音频、视频参考)转换成 H3-Base 可以直接执行的结构化上下文中间表示(Context Intermediate Representation)。本文深度拆解 H3-Context-IR 的工作原理、内部工作流、与 H3-Base 的接口设计,以及如何在不接入 API 的情况下手动复现其功能。 - [浏览器里的全格式 3D 查看器:kovacsv/Online3DViewer,18 种格式,文件从不离开你的设备](https://blog.mushroom.cv/blog/online3dviewer-browser-3d-18-formats-step-ifc-embed-library-mit/): kovacsv/Online3DViewer(3dviewer.net)是一个运行十年的开源浏览器 3D 查看器,MIT 许可,同时也是一个 npm 库(online-3d-viewer,月下载 6 万次)。支持 18 种格式导入(含 STEP/IGES/IFC/FreeCAD/Rhino)、7 种格式导出,工程 CAD 格式依靠 WASM 版 OpenCASCADE(occt-import-js)驱动。所有处理在浏览器内完成,文件永不上传。提供两种嵌入方式:一行 div 自动初始化,或通过 EmbeddedViewer API 完全编程控制。 - [M5 Air 16GB 本地跑 33B 视频模型:vpipe 实测,15 分钟生成 3.75 秒有声视频](https://blog.mushroom.cv/blog/vpipe-minimax-h3-apple-silicon-video-audio-local-metal-cpp-pipeline/): tgo-app-dev/vpipe 是一个 C++ 编写的苹果芯片多模态 AI 运行时,整个 build 产物不到 25MB。它把 MiniMax H3(33B)跑在 16GB M5 MacBook Air 上——视频和音轨由同一个去噪循环生成,不是事后配音。实测 960×544 / 24fps / 3.75s / 8-step DiT,约 15 分钟。项目完成度极高:pipeline JSON 规范、浏览器 Web UI、手机扫码接入、本地 MCP 工具支持、重量流式加载、M5 NAX 加速,Apache 2.0 开源。 - [AI 水印是怎么打进文字的,又是怎么被去掉的:watermarks-remover 三层解剖](https://blog.mushroom.cv/blog/watermarks-remover-ai-provenance-c2pa-synthid-statistical-open-source/): guillaumemeyer/watermarks-remover 开源了一套针对 Claude、Gemini SynthID、OpenAI 和开源模型的三层 AI 溯源标记清除方案:Layer A 消除不可见 Unicode 字符,Layer B 对统计采样水印做重写攻击,File 层剥离 PNG/JPEG/PDF/DOCX 等格式的 C2PA 和元数据。项目 2 天内获得 3000+ stars。文章从技术原理出发,拆解每种水印的工作机制和清除路径,以及这个话题背后的隐私与内容溯源之争。 - [阿里开源 OpenCodeReview:确定性流水线 + Agent 混合架构,精度比 Claude Code 高、Token 只用 1/9](https://blog.mushroom.cv/blog/alibaba-open-code-review-agent-deterministic-hybrid-llm/): alibaba/open-code-review,⭐20,233,Apache-2.0,Go,2026-05-18。阿里巴巴集团内部 AI 代码审查工具开源,2 年内服务数万开发者、发现数百万代码缺陷。核心架构:确定性工程流水线(精确文件选取、智能文件捆绑、细粒度规则匹配、外部定位和反思模块)× LLM Agent(场景调优提示词 + 生产数据蒸馏工具集)。基准测试(50 个开源仓库、200 个真实 PR、10 种语言、80+ 高级工程师交叉标注 1505 个 ground-truth issue):与使用相同底层模型的 Claude Code 相比,F1 和 Precision 显著更高,Token 消耗仅约 1/9。支持三种审查模式:工作区变更、分支范围、全文件扫描;支持委托模式(让你的 AI coding agent 执行审查,无需 OCR 自己的 API Key)。集成 Claude Code、Codex、Cursor,支持 GitHub Actions、GitLab CI、Gerrit。 - [Cloudflare Mesh:赛博菩萨的 Tailscale 平替,免费 50 节点 + 容器化部署](https://blog.mushroom.cv/blog/cloudflare-mesh-tailscale-alternative-private-network-docker-k8s/): Cloudflare Mesh 是 Cloudflare One 旗下的私有网格网络服务,原名 WARP Connector,一句话定义:CF 版 Tailscale。手机、电脑、服务器、AI 机器人,只要安装 Cloudflare One Client 就能拉进同一个加密局域网,每台设备分配一个 Mesh IP(100.96.0.0/12 CGNAT),通过 Cloudflare 全球网络路由,自带后量子加密。免费额度:50 节点 + 50 用户。2026-08-07 新增官方容器镜像(Docker Hub: cloudflare/mesh),支持 Docker Compose、Kubernetes StatefulSet/Sidecar、CI/CD,同 Token 多副本自动故障转移。开启路径:Cloudflare 后台 Networking → Mesh。 - [Higgsfield Zephyr: Special 全开源:K-pop 机甲 AI 电影的完整制作工艺](https://blog.mushroom.cv/blog/higgsfield-zephyr-special-kpop-mecha-ai-film-open-source-seedance/): Higgsfield 将旗下 K-pop 机甲 AI 短片系列《ZEPHYR: Special》的完整制作过程全部开源:所有提示词、角色资产、失败镜头、最终剪辑版本,共 197 个资产公开发布于平台上,任何人都可以直接进入 Cinema Studio 查看和复用。主创团队披露了两个「不可能镜头」的实现方法:倒置角色参考图技巧和锚点式最小提示词策略。底层模型是 Seedance 2.5,结合 Higgsfield Soul 2 进行角色和服装设计,再用 Nano Banana 2 Pro 精修成最终资产。文章总结了整条 AI 电影工业流水线——从角色开发、机甲设计、场景控制,到 Higgsfield 全平台工具组的工程假设和实战指导。 - [IndexTTS-2.5:生产级零样本 TTS,一段参考音频克隆音色 + 细粒度情感与语速控制](https://blog.mushroom.cv/blog/index-tts-25-production-tts-voice-clone-emotion-multilingual/): index-tts/index-tts,⭐22,615,Python,2026-08-10 发布 IndexTTS-2.5。零样本文本转语音系统,一段参考音频即可克隆音色。支持中文、英文、日语、西班牙语、阿拉伯语五种语言,跨语言音色保持。8维情感向量(愉快/愤怒/悲伤/恐惧/厌恶/忧郁/惊讶/平静),支持情感参考音频、文本情感自动转换、显式情感描述四种控制方式;duration_factor 语速控制(0.5×–2.0×);拼音/CMU音素/日语假名发音精确控制。推理比 IndexTTS-2 更快,vLLM 生产部署。 - [浏览器里的 3A 特效工厂:纯 Three.js 打造 10 种游戏技能,938 个参数全部可实时调节](https://blog.mushroom.cv/blog/threejs-elemental-sandbox-vfx-browser-real-time-procedural-glsl/): achrefelouafi 开源的 Elemental Sandbox 用 Three.js + Vite + 手写 GLSL,在浏览器里程序化生成 10 种 3A 游戏级技能特效——冰霜迸裂、枝状闪电、陨石撞击、能量光束、虚空刀刃、凤凰……全部无贴图、无精灵表、无预烘焙网格。938 个参数配有实时滑块,按 P 暂停后仍可继续调整,成为研究游戏 VFX 系统的最佳交互式沙盒。MIT 许可,npm run dev 即跑。 - [huggingface/speech-to-speech:一行命令跑起本地语音 Agent 完整管道](https://blog.mushroom.cv/blog/huggingface-speech-to-speech-voice-agent-vad-stt-llm-tts-local/): huggingface/speech-to-speech,12,080 stars,Apache-2.0,Python。低延迟、完全模块化的语音 Agent 管道:VAD → STT → LLM → TTS,通过 OpenAI Realtime 兼容的 WebSocket API 暴露。每个组件可独立替换,LLM 槽位支持 OpenAI 兼容协议——可以指向云端提供商、HF Inference Providers,或者本地 vLLM/llama.cpp,实现完全本地、完全开源的语音 Agent 栈。已在数千台 Reachy Mini 机器人上生产运行。一行 pip 安装,三行命令启动。 - [LTX-2:Lightricks 开源 22B 音视频 DiT,开源视频生成进入三强时代](https://blog.mushroom.cv/blog/ltx-2-lightricks-audio-video-22b-dit-open-source/): Lightricks 开源 LTX-2(内部版本 LTX-2.3),22B 参数,首个基于 DiT 的音视频联合基础模型。一次推理同步生成画面与声音,原生 4K,最高 50fps,单次最长 10 秒。Gemma-3 12B 作为文本编码器,提供 11 条专用 Pipeline(T2V/I2V/A2V/关键帧插值/视频延伸/Dub-It 配音/HDR 等),IC-LoRA 精准控制(深度/姿态/Canny/运动轨迹),支持 ComfyUI 与 LoRA 训练。开源视频生成领域三强格局初现:MiniMax H3、LTX-2,以及即将开源的 FLUX3。 - [maintain-repo-wiki:让 LLM Agent 把工程事实而非总结写进 Wiki](https://blog.mushroom.cv/blog/maintain-repo-wiki-llm-engineering-wiki-skill-repo-self-evolution/): dingrancho-alt/maintain-repo-wiki,13 stars,Python,2026-07-07。面向单仓库/多仓库的生产级工程 Wiki Skill:不把代码「总结成一篇文档」,而是把接口契约、字段传播、业务流程、排障路径这类可验证工程事实组织成能持续更新、审计、检索的知识系统。三种知识库拓扑(Repo/System/Knowledge Repo)、九类页面、Audit→Confirm→Apply 受控写入流程、可选 Capability Layer(Operation→Atomic→Composite 三层模型),配套 changed_files.py / wiki_lint.py / capability_graph.py 脚本。无证据时记为 unknown,不用推测补齐。 - [Meta Muse Glimmer 30B:专为本地 Agent 设计的 30B 小钢炮](https://blog.mushroom.cv/blog/meta-muse-glimmer-30b-local-agent-dense-multimodal-apache/): Meta 开源 Muse Glimmer 30B,29.6B 参数 Dense 架构,图像+文本输入,131K 上下文,由 Muse Spark 蒸馏,重点训练 Agent、多步推理、Tool Use、Coding 和失败恢复。4bit 量化不到 20GB,24GB 显存可跑,RTX 5090 配合 DFlash 推测解码达 233 tok/s,M4 Max 约 37.8 tok/s,M5 Max 约 50.2 tok/s。SWE-Bench Verified 76.0,MCP Atlas 75.5。Apache 2.0,权重直接开放。扎克伯格同步确认 Muse Spark 1.2 权重即将开放。 - [Shannon:只报告能证明的漏洞——Keygraph 的 AI 渗透测试 Agent](https://blog.mushroom.cv/blog/shannon-keygraph-ai-pentester-web-api-autonomous-exploit/): KeygraphHQ/shannon,46,621 stars,AGPL-3.0,TypeScript,2025-09-27 开源。Keygraph 开发的自主 AI 渗透测试工具,专为 Web 应用和 API 白盒测试设计,核心主张是「证明式漏洞报告」——只报告能用 PoC 验证的真实漏洞,拒绝输出推测性告警。多 Agent 架构:源码分析→攻击面侦察→并行漏洞分析(Injection/XSS/SSRF/Auth)→真实 Exploit→报告。npx 一键启动,运行在 Docker 容器内,支持 Claude/OpenAI/xAI/Bedrock。Shannon 2.0 已正式发布。仅限用于已拥有或有书面授权的系统。 - [PenguinHarness:用 4 个 Skill 把 Agent 调优变成有版本、有固定考题、有分数记录的实验闭环](https://blog.mushroom.cv/blog/penguin-harness-self-evolving-agent-builder-skills-benchmark/): Prism-Shadow/penguin-harness,1140 stars,Apache-2.0,TypeScript。LlamaFactory 作者 Yaowei Zheng 的新项目,2026-07-19 开源。全自动 Agent 构建平台:一句话让 Agent 构建 Agent 应用(DeepSeek V4 Pro 跑一个 RAG 应用花费 $0.02),数据分析准确率最高、成本是 Claude Code 的 1/70。核心亮点是 Agent Tuning 四 Skill 闭环:agent-creation → benchmark-design → agent-evaluation → agent-optimization,每轮改进前自动快照,严格高于基线才接受,否则回滚。支持 DeepSeek/Kimi/GLM/Claude/Gemini,桌面端+CLI+SDK 三种运行方式。 - [authentik 2026.8:OpenID 官方认证、Rust 重写、PAM,自托管 IdP 的新里程碑](https://blog.mushroom.cv/blog/authentik-2026-8-oidc-certified-rust-rewrite-pam/): goauthentik/authentik 开源 Identity Provider,24k stars,Python,自托管替代 Okta/Auth0/Entra ID。v2026.8 三大亮点:通过 OpenID Foundation 官方认证(8个profile)、服务器与 Proxy Outpost 完成 Rust 重写、企业版新增特权访问管理(PAM)。另有用户多账号切换、自定义字段、LDAP 嵌套组同步、策略绑定到期、PostgreSQL 连接池支持。 - [code-review-graph:给 AI 编程助手建一张本地代码关系图,中位数减少 65 倍 token 用量](https://blog.mushroom.cv/blog/code-review-graph-tirth8205-blast-radius-token-reduction/): tirth8205 开源的本地代码智能图工具,29.5k stars,Python,MIT License。用 Tree-sitter 把代码库解析成函数/类/调用/测试的关系图,存储在 SQLite;代码审查时只把受影响的文件和调用链(Blast Radius)交给 AI,而不是整个代码库。六个真实仓库测试:中位数减少 65 倍 token 用量,最大 376 倍(fastapi)。支持 15+ AI 编程平台,30+ 编程语言,增量更新 2.5 秒。 - [Comp AI CRM:CRM 不是产品,是 AI Agent 的笔记本](https://blog.mushroom.cv/blog/compai-crm-agentic-first-open-source-eve-vercel/): Trycompai/crm,7.9k stars,MIT,TypeScript。一个设计哲学完全颠倒的 CRM:不是给人用、在里面配 AI 的,而是给 Agent 用、人去里面看 Agent 记了什么的。基于 Vercel 的 eve 框架(持久化 Agent 运行时),18个工具、4个 skill、1个调度器,自己决定下一步看谁、记什么、什么时候回来复查。核心原则:Agent 永远不猜——工具只报告观察到的,不接受置信度评分。 - [Crawl4AI:把网页变成 AI 能读懂的文本——完整实践指南](https://blog.mushroom.cv/blog/crawl4ai-open-source-llm-web-crawler-scraper-guide/): unclecode/crawl4ai,77.6k stars,Apache 2.0,Python,GitHub #1 开源爬虫。专为 LLM 和 AI Agent 设计:直接输出干净 Markdown,支持 JS 动态页面、深度爬取(BFS/DFS)、会话保持、代理、CSS/XPath/LLM 结构化提取、Docker API。适用场景:品牌研究、竞品分析、用户评价聚合、论坛舆情、产品情报。本文是真实使用视角的完整指南:原理、安装、核心用法、三个具体案例、适用边界。 - [LifeOS:从「怎么说」到「要什么」——Daniel Miessler 的 AI 生活操作系统](https://blog.mushroom.cv/blog/danielmiessler-lifeos-ai-harness-intent-engineering-current-ideal-state/): danielmiessler/LifeOS,17.5k stars,MIT,TypeScript。fabric 作者 Daniel Miessler 的新项目:一套运行在 AI coding agent 之上的「生活操作系统」。核心命题是从「提示词工程」转向「意图工程」——不是告诉 AI 怎么做,而是捕获你是谁、你想到哪里去,让系统用你的全部上下文驱动 AI 持续爬向你的 Ideal State。22个核心组件,从 TELOS(使命/目标)到 Cortex(跨会话记忆),装一次,伴随一生。 - [Gemma Translator:用树莓派 5 做一台完全离线的双向语音翻译机](https://blog.mushroom.cv/blog/gemma-translator-google-offline-voice-raspberry-pi/): Google Gemma 团队开源的全离线双向语音翻译项目,JavaScript/Python,Apache 2.0。以树莓派 5(8GB)为目标硬件,Gemma 4(gemma4-e2b)通过 LiteRT-LM 本地推理,Moonshine 负责语音识别和 TTS 合成。双通道设计:两个人面对面,各自说母语,实时互译。一键部署为永久 kiosk 服务。源码来自 Google Antigravity 实验。 - [Herdr:用牧羊人的方式管理你的 AI Agent 群](https://blog.mushroom.cv/blog/herdr-coding-agent-runtime-persistent-terminal-multiplexer-rust/): herdrdev/herdr,26.5k stars,Apache 2.0,Rust。一个专为多 AI Agent 时代设计的终端持久化运行时:关盖子、断网络、重启机器——Agent 继续跑,session 继续在,随时从任何终端或 SSH 重连。每个 pane 实时标注 working/blocked/idle 状态,Agent 卡住需要人介入时主动告知。单 Rust 二进制,无 Electron,支持 Claude Code/Codex/Cursor/opencode/Grok,有插件市场。 - [Midday:两个人的财务 OS,被 Ramp 收购前已服务 2 万家公司](https://blog.mushroom.cv/blog/midday-ramp-acquisition-two-founders-financial-os/): midday-ai/midday,14.7k stars,AGPL-3.0,TypeScript + Rust。两位创始人 Pontus & Viktor 从2023年做起,为「一个人跑一家公司」设计了一套财务操作系统:接入2万家银行、处理170万笔交易、8.12亿美元交易额。2026年5月被 Ramp 收购。它同时戳中了两类人:AI 创业者看到的是 2 人团队能做什么,独立创业者看到的是自己终于有了合适的工具。 - [OpenWorker:吴恩达开源的 AI 协作者,交付成品而不是对话](https://blog.mushroom.cv/blog/openworker-andrewyng-ai-coworker-25-integrations-local-first/): andrewyng/openworker,13.8k stars,MIT,Python + Rust + React。吴恩达开源的桌面 AI 协作者,核心命题:给你交付完成品(文档、Slack 回复、更新后的日历),而不是下一步待办清单。25+ 应用集成,支持 OpenAI/Anthropic/Gemini/DeepSeek/Kimi/Ollama 等12个供应商,本地优先,写入/发送/运行命令前必须用户审批。基于 aisuite 构建。 - [Ploy:Webflow 联合创始人的第三次创业——用 AI Agent 把网站变成增长引擎](https://blog.mushroom.cv/blog/ploy-ai-webflow-founder-website-growth-engine-27m/): Bryant Chou(Webflow 联合创始人兼前 CTO,任职 12 年)创立的 AI 营销平台 Ploy,2026 年 6 月以 2700 万美元种子轮融资从 YC S26 出发。核心命题:网站不应该是静态手册,而是始终运转的增长引擎。三个 Agent 模块(Ploy Web 建站优化、Ploy Grow 访客识别外联、Ploy Ads 广告投放归因)持续运转,13% 的 YC P26 公司已在使用。 - [Sleepless:盖上盖子不睡觉——用 pmset 解决 Mac 最顽固的痛点](https://blog.mushroom.cv/blog/sleepless-aboudjem-macbook-lid-closed-battery-pmset/): Aboudjem/Sleepless,Swift,MIT。macOS 原生菜单栏工具,用 pmset disablesleep 让 MacBook 盖盖后仍保持唤醒——不需要外接显示器,不需要电源,有电量底线和自动关闭定时器。Amphetamine/KeepingYouAwake/caffeinate 都解决不了这个问题;Sleepless 是唯一用对了机制的开源替代方案。 - [AirLLM:4GB 显存跑 70B 大模型,无需量化](https://blog.mushroom.cv/blog/airllm-70b-inference-4gb-gpu-layer-streaming/): lyogavin 开源的大模型极限推理工具,30k stars,Apache 2.0。通过逐层流式加载,在单张 4GB 显卡上运行 70B 模型,无需量化/蒸馏/剪枝。Kimi K3(2.8T)3.72GB、DeepSeek-V3(671B)约 12GB、Qwen3-235B 约 3GB。v3.0 新增 FP8 支持。支持 CUDA、Apple Silicon(macOS),同一 AutoModel 接口覆盖所有主流模型。 - [DeepSeek-Reasonix:围绕前缀缓存稳定性设计的终端编程 Agent](https://blog.mushroom.cv/blog/deepseek-reasonix-terminal-coding-agent-prefix-cache/): esengine 开源的 DeepSeek 原生终端编程 Agent,33k stars,MIT License,Go 重写版。架构核心是前缀缓存稳定性——真实用户单日 435M 输入 token,99.82% 缓存命中,实际费用 ~$12 而非 ~$61。支持长时运行、QQ 频道远程接入、Tauri 桌面客户端,npm install -g reasonix 一键安装。 - [kimi-bridge:用微信/飞书/QQ 控制本地 Kimi Code Agent](https://blog.mushroom.cv/blog/kimi-bridge-im-kimi-code-wechat-feishu-qq-control/): Mtrya 开源的 IM 控制层,Python/MIT。让你从微信、飞书、QQ 或 Telegram 直接操控本地运行的 Kimi Code Agent——持久化会话绑定、流式输出、语音转写、审批/提问交互、权限模式、/goal 目标、/skills 技能、/mcp 工具查看,一行命令安装,支持 Agent 驱动全自动配置。 - [微软 AI For Beginners:63k Stars 的 12 周 24 课 AI 入门课程](https://blog.mushroom.cv/blog/microsoft-ai-for-beginners-12-week-24-lesson-curriculum/): 微软开源的系统性 AI 入门课程,63k stars,MIT License。12 周 24 课,涵盖符号 AI、神经网络、计算机视觉、NLP、强化学习和 Transformer,每课附 PyTorch/TensorFlow 实验、测验和 Lab,55+ 语言翻译,零基础可学。 - [nature-skills:学术论文全流程 18 个 AI Skill,两个月 3.4 万星](https://blog.mushroom.cv/blog/nature-skills-yuan1z0825-academic-paper-skill-collection/): 袁一哲(Yuan1z0825)发起、开源社区共同维护的 Nature 级学术论文 AI Skill 合集,18 个技能覆盖图表、润色、写作、投稿、审稿回复、引用核验、数据管理、PPT、专利转化、文献检索全链路,Apache 2.0,发布两个月 GitHub 3.4 万星。npx skills add Yuan1z0825/nature-skills 一键安装,支持 Claude Code / Codex / OpenClaw / OpenCode / Hermes。 - [NVIDIA VoiceChat 11B:第一个支持工具调用的开源全双工语音 Agent](https://blog.mushroom.cv/blog/nvidia-voicechat-11b-full-duplex-tool-calling-speech-agent/): NVIDIA NemotronLabs 开源的 11B 端到端全双工语音模型,2026-08-03 发布,OpenMDW 1.1 研究许可。统一架构同时完成流式语音理解和语音生成,转轮延迟约 450ms,VoiceBench #2(开源全双工),史上第一个支持工具调用的开源全双工模型——边说话边触发工具,工具执行期间模型自动播放占位语音保持对话流畅。 - [Prime Agent:PrimeIntellect 开源的自改进 RLM 编程 Agent](https://blog.mushroom.cv/blog/prime-agent-primeintellect-self-improving-rlm-coding-agent/): PrimeIntellect 开源的自改进 Agent,7.6k stars,MIT License。引入 RLM(递归语言模型)把 context 当变量、工具调用当函数,运行在持久 IPython REPL 中。通过 Continual Harness 把提示词/记忆/技能描述持久化为可精炼的 durable state,支持子 Agent 并行、后台 daemon 会话、Agent 间直接通信、/goal 跨轮次持久目标和 /autonomous 自主模式。 - [reverse-skill:给 AI Agent 装上逆向工程与渗透测试的神经系统](https://blog.mushroom.cv/blog/reverse-skill-ai-agent-cybersecurity-penetration-skill-router/): zhaoxuya520 开源的 AI Agent 安全技能路由包,20.9k stars,MIT License。解决 AI Agent 做安全分析时不知道用哪个工具的核心痛点——41条路由规则自动识别任务类型(APK/ELF/JS/PCAP/CTF),按需自举 jadx/Frida/Ghidra/BurpSuite 等工具链,自动沉淀经验到知识库。支持 Claude Code、Codex、Cursor、Kiro、Cline。 - [TencentDB Agent Memory:腾讯云开源的团队级 Agent 记忆系统](https://blog.mushroom.cv/blog/tencentdb-agent-memory-team-level-symbolic-layered-memory/): 腾讯云 AI Agent 团队开源的记忆系统,17.9k stars,TypeScript。核心思路:符号短期记忆(Mermaid 状态图替代 verbose 工具日志,-61.38% token 用量)+ 分层长期记忆(L0 对话→L1 原子事实→L2 场景→L3 用户画像)。WideSearch 任务成功率 +51.52%,PersonaMem 准确率从 48% 升至 76%。支持 OpenClaw / Hermes Gateway,一行命令接入。 - [The Agentic Startup:给 Claude Code 装一套创业团队工作流](https://blog.mushroom.cv/blog/the-startup-rsmdt-claude-code-spec-driven-multi-agent/): rsmdt 开源的 Claude Code 多智能体框架,367 stars,MIT License,Shell。核心思路:先写规格再写代码(spec-driven development)。10 个 slash command 覆盖从需求到交付的全流程,三级复杂度自动分发(Direct/Incremental/Factory),v3 新增实验性 Agent Teams 多智能体协作。两个 Marketplace 插件,一行安装。 - [TradingAgents:把交易公司搬进 AI——96k Stars 的多 Agent 金融交易框架](https://blog.mushroom.cv/blog/tradingagents-multi-agent-llm-financial-trading-framework/): TauricResearch 开源的多 Agent LLM 量化交易框架,96k+ stars,Apache 2.0。用 LangGraph 构建 7 种专职角色:基本面/情绪/新闻/技术分析师 + 多空研究员 + 交易员 + 风控/投资组合经理。支持 OpenAI/Claude/Gemini/DeepSeek/Kimi/Qwen/GLM/Ollama 等全系列 LLM,覆盖美股/港股/A股/加密货币,附 arXiv 论文 2412.20138。 - [Argus:让 Agent 干完整件事的持久化四角色运行时](https://blog.mushroom.cv/blog/argus-persistent-agentic-runtime-long-horizon-four-role-self-evolution/): Argus 是一个开源 Agent 运行时框架,通过 Manager→Planner→Engineer⇄Reviewer 四角色分工,把长周期任务的执行与判断强制分离,项目状态跨会话持久化存储。SWE-Bench Pro 达 78%,成熟 wave 比初始 wave 少用 21% tokens,并附 arXiv 论文。支持 Copilot、Codex CLI、Claude Code、OpenCode 等多种后端。 - [Call.md:把会议变成实时 Agent 循环的 AI 会议助手](https://blog.mushroom.cv/blog/call-md-videodb-ai-meeting-real-time-mcp-agent-loop/): VideoDB 开源的 Electron 桌面 AI 会议助手。双声道实时转录(自己 vs 对方),会中 AI 实时建议+MCP 工具自动触发,会后生成结构化纪要+Action Items,一键同步到 n8n/Zapier/CRM。当前 575 stars,TypeScript + React 19 + tRPC 构建。 - [Cloudflare 把浏览器也 Serverless 了:Kitesurf 调研](https://blog.mushroom.cv/blog/cloudflare-kitesurf-agent-browser-rust-wasm-v8-isolate/): Cloudflare 开源了 Kitesurf,一个专为 AI Agent 构建的浏览器,完全跑在 Cloudflare Workers 上。没有 Chrome 进程,Rust+WASM 做引擎,页面 JS 直接跑在 V8 isolate 里。CPU 消耗比 Chromium 低 3-4x,内存低 5-7x。本文深度分析架构、性能数据、工程接入方式,以及这件事对 AI Agent 基础设施的意义。 - [Google Maps 变成 Agent:点餐、订酒店、购票全打通,附工程接入指南](https://blog.mushroom.cv/blog/google-maps-ask-maps-agentic-food-ordering-hotel-bookings/): Google Maps Ask Maps 新增 agentic 能力:通过 Square/Toast/Uber Eats 下单外卖、比价预订酒店、查询演出购票,Personal Intelligence 接入 Gmail 和 Google Calendar 提供上下文感知(默认关闭)。本文分析这次更新的战略意图,并给出餐饮/酒店/票务/SaaS 开发者的完整工程接入路径。 - [TRELLIS.2:微软 4B 参数图像转 3D 生成模型,引入原生 O-Voxel 表示](https://blog.mushroom.cv/blog/microsoft-trellis2-native-3d-generation-o-voxel-pbr/): 微软开源的 4B 参数 3D 生成模型。引入 O-Voxel(无等值面约束的稀疏体素)解决复杂拓扑问题,支持开放曲面、非流形几何和内部封闭结构。H100 上 512³ 约 3 秒,1024³ 约 17 秒。支持完整 PBR 材质(颜色/粗糙度/金属度/透明度),MIT License,arXiv 2512.14692,当前 10.4k stars。 - [Pi 编程 Agent 缺什么,pi-muselinn-harness 就补什么](https://blog.mushroom.cv/blog/pi-muselinn-harness-kimi-code-subagents-goal-plan-tui/): pi-muselinn-harness 是一个 TypeScript 扩展包,把 Kimi Code 的核心子系统——Swarm 并行子 Agent、Goal 生命周期、Plan 模式、18 级权限链、Hooks 引擎、7 范围 Skills——移植进 Pi 编程 Agent。架构上做了 core/adapter 分离,23 个测试套件 660+ 断言,CI 覆盖 macOS/Ubuntu/Windows × Node 24/26。 - [AI运营公司完全指南:ThirstySprout的零融资破局方法论](https://blog.mushroom.cv/blog/thirsty-sprout-ai-company-operations-guide/): 一家没有融资的AI人才公司,2年亏损后做到年收入$2.5M、月收入$208K。本文系统整理其10步完整方法论:从机会识别、先做服务再做平台、商业模式设计、冷启动解法、增长飞轮,到AI Native小团队模型和护城河构建。 - [video-shotcraft:让 AI Agent 直接制作院线级产品宣传片](https://blog.mushroom.cv/blog/video-shotcraft-claude-code-remotion-cinematic-product-videos/): Vincentwei1021 开源的 Claude Code / Codex Agent 视频制作技能包,3832 stars。内置 104 张镜头配方卡、161 种运动风格预览、完整 Remotion 视频模板 Ink Press(36.2秒/1920×1080/30fps)、149 个音效(16个场景类别)、5套背景音乐。Agent 拿到产品截图后自动分镜、动画、配音设计,直出可发布的产品宣传片。 - [UniFace:把人脸分析全套能力统一到一个 Python API](https://blog.mushroom.cv/blog/yakhyo-uniface-python-face-analysis-unified-library/): yakhyo 开源的 Python 人脸分析统一库,944 stars。单一 API 覆盖:检测(RetinaFace/SCRFD/YOLOv8-Face)、识别(ArcFace/AdaFace)、追踪(BYTETracker)、106/468 点关键点、语义分割、人像抠图(MODNet)、注视估计、头部姿态、属性分析(年龄/性别/情绪)、活体检测、质量评估,支持 Apple Silicon / CUDA / CPU,模型自动下载。 - [Kiro Crew:开发 Agent 之上的持续工作层,会话/记忆/定时/审批/多 Agent 一体](https://blog.mushroom.cv/blog/kiro-crew-persistent-agent-workspace-sessions-memory-schedule/): Kiro Crew 是运行在 Kiro(AWS 的 Agentic IDE)之上的开源持续工作层:Gateway 进程常驻本地或远程机器,跨 session 保存上下文和教训,支持定时任务/心跳监控/审批/并行子 Agent,通过 Slack/Telegram/WeCom/微信等渠道随时继续同一个工作。起源于 Amazon 内部项目 MeshClaw,6 个月内积累 39000 开发者,今日正式开源。 - [LoopX:长任务 Agent 的本地状态内核,目标/门控/待办/证据/配额全管](https://blog.mushroom.cv/blog/loopx-loop-engineering-state-kernel-long-running-agents/): LoopX 是一个轻量状态内核和本地控制平面,让 Codex、Claude Code、Cursor 等 Agent 跑长任务时有持久的目标、门控、可执行待办、证据日志和可验证交接。不替换你的 Agent 运行时,只管它跑多轮任务时不跑偏。Python 3.11+,无额外运行时依赖,MIT,已有 200+ 小时跑通的真实轨迹。 - [Ponytail:把「最懒的资深工程师」塞进你的 AI Agent——54% 代码减少,100% 安全](https://blog.mushroom.cv/blog/ponytail-lazy-senior-dev-ai-agent-simplicity-skill/): Ponytail 是一个 AI Agent 插件(Claude Code / Codex / Gemini / Cursor 等 20+ 平台),让 Agent 在写代码前先过一遍「最小可行解」的七级阶梯:从 YAGNI、复用、stdlib、原生平台特性,到单行实现,最后才是最小化实现。真实基准测试:-54% 代码量、-20% 成本、-27% 时间,安全检查 100% 通过。97K stars,MIT,JavaScript。 - [@cloudflare/computer:给每个 Agent 一台自己的电脑](https://blog.mushroom.cv/blog/cloudflare-computer-agent-runtime-isolate-container/): Cloudflare 在 Agents Week 发布 @cloudflare/computer:让 Agent 在同一个虚拟文件系统里动态切换 Isolate(快、廉价)和 Container(完整 Linux),把 Durable Object 的水平无限扩展和容器的垂直能力合二为一。早期预览已开源,给 AI 编程/任务 Agent 提供新的计算基础。 - [Cloudflare 悄悄把 GLM-5.2、Kimi K3、DeepSeek V4 都接上了,而且只要一个 token](https://blog.mushroom.cv/blog/cloudflare-workers-ai-glm-kimi-deepseek-minimax/): Cloudflare Workers AI 已上线 GLM-5.2、Kimi K2.7 Code、1M 上下文的 Kimi K3、DeepSeek V4 Pro、MiniMax M3,同一个 token、同一行代码即可调用,还理清了自托管与第三方托管的价格和数据边界。 - [Crona:给住在终端里的开发者的本地优先工作追踪器](https://blog.mushroom.cv/blog/crona-webxsid-local-first-terminal-work-tracker-developer/): webxsid/Crona 是一个 Go 编写的本地优先开发者工作追踪工具:后台 daemon 持有 SQLite 状态,TUI(Bubble Tea)和 CLI 作为客户端通过本地 IPC 交互。支持专注会话计时、习惯追踪、健康度看板、.ics 日历导出,数据全部本地存储,无云耦合。28 stars,MIT 开源。 - [Growth Lab:用 Claude Code 或 Codex 跑完整增长闭环,小红书单篇 4000+ 赞](https://blog.mushroom.cv/blog/growth-lab-tsingyuai-claude-code-codex-end-to-end-growth-agent/): tsingyuai/growth-lab 以 Claude Code 或 Codex 为 Runtime,把从理解产品到执行分发再到结果复盘的完整增长闭环变成 Agent 工作流。已实现 SEO 页面增长(点击量 +1000%)和小红书爆款复刻(单篇 4000+ 赞)两个完整闭环。434 stars,Apache-2.0。 - [LongHorizon-Harness:让 AI Agent 真正干完长任务的执行框架](https://blog.mushroom.cv/blog/longhorizon-harness-amap-ml-ai-agent-long-task/): AMAP-ML 开源的 LongHorizon-Harness 用三角色分工(Manager/Executor/Auditor)解决 AI Agent 的长任务失效问题:每轮 Executor 用全新上下文执行,Auditor 独立验证环境,只有通过验证的进展才写入持久状态。WeaveBench 提升 +28.9pp,OSWorld 2.0 提升 3×,支持 Claude Code/Codex/OpenClaw,MIT 许可。 - [Marble 开源儿童课程知识图谱:1590 个微话题 + 3221 条前置关系,对齐主流课标](https://blog.mushroom.cv/blog/marble-os-taxonomy-children-curriculum-knowledge-graph/): withmarbleapp/os-taxonomy 是 Marble 开源的儿童小学阶段学习知识图谱:1590 个可教授微话题(科学/数学/英语等8科)+ 3221 条有向前置依赖边 + 对齐 NGSS/Common Core/英国课程标准。纯 JSON 数据,ODbL 1.0 + CC BY-SA 4.0 双许可,可用于构建 AI 家教、自适应学习路径和课程分析工具。3849 stars。 - [MiniMax H3 开源实测:ComfyUI 三分钟上手,工程部署完全指南](https://blog.mushroom.cv/blog/minimax-h3-comfyui-open-source-video-generation-engineering-guide/): MiniMax H3 于 2026-07-31 开源,是目前最强的开源视频生成模型之一:33B Omni Transformer,视频+原生立体声同步生成,支持 2K 分辨率、最长 15 秒、11 种语言。本文覆盖能力分析、硬件配置清单(消费卡/数据中心/Apple Silicon)、ComfyUI 快速上手、SGLang 生产部署和工程最佳实践。 - [OpenMinis 实测 + 隐私架构完全指南:本地大模型 + Tailscale,个人数据永不出家门](https://blog.mushroom.cv/blog/openminis-private-personal-ai-tailscale-local-model-complete-guide/): OpenMinis 是一个开源 iOS/Android AI Agent,能直接访问你的日历、健康、照片、提醒事项、HomeKit,内置 Alpine Linux 环境。但它默认接外部大模型——你的私人数据就这样发走了。本文分析 OpenMinis 架构,给出完整的隐私优先方案:本地大模型(Ollama/llama.cpp)+ Tailscale 组网,手机 Agent 调用家里电脑的模型,数据全程不出内网。 - [OpenSquilla 0.5.2:同等预算,9× token 成本降低,靠的是本地 Agent 路由器](https://blog.mushroom.cv/blog/opensquilla-token-efficient-ai-agent-squilla-router/): OpenSquilla 把「这一步用哪个模型」的决策内化到 Agent 本身:SquillaRouter 是一个在设备上运行的 LightGBM+ONNX 分类器,每个 turn 评估复杂度后路由到最便宜的胜任模型,prompt 从不离开本机做这个决策。PinchBench 结果:分数持平(0.9251 vs 0.9255),成本从 $6.23 降到 $0.69,减少 89%。6535 stars,Apache 2.0,v0.5.2 稳定版。 - [WrenAI:开源 GenBI 引擎,让 AI Agent 生成可信 SQL 和可部署的数据看板](https://blog.mushroom.cv/blog/wrenai-text-to-sql-genbi-open-source-context-layer/): WrenAI(Canner)是开源的 GenBI(Generative BI)引擎:通过开放上下文层(MDL 语义模型 + instructions.md + LanceDB 记忆),让 AI Agent 把自然语言问题转化为受治理的 SQL,并一键部署到 Vercel/Cloudflare Pages 的交互式看板。支持 22+ 数据源,与 Claude Code/Cursor/Codex 原生集成,Apache 2.0,16921 stars。 - [AI Knowledge Graph:把任意文本扔进去,LLM 自动生成可交互知识图谱](https://blog.mushroom.cv/blog/ai-knowledge-graph-robert-mcdermott-unstructured-text-to-interactive-graph/): robert-mcdermott/ai-knowledge-graph 用 LLM 把非结构化文本转换成主谓宾三元组,经过实体标准化和关系推断,生成带社区检测的可交互 HTML 知识图谱。支持 Ollama 本地跑,兼容任意 OpenAI 兼容端点,2.7K stars,Apache-2.0。 - [Astral3D:Vue3 + Three.js 打造的免费开源 Web 3D 编辑器,支持 BIM/CAD/30+ 格式](https://blog.mushroom.cv/blog/astral3d-vue3-threejs-3d-editor-bim-cad-webgpu/): mlt131220/Astral3D 是基于 Vue3 + Three.js 的现代 Web 3D 编辑器,支持 30+ 模型格式(GLTF/OBJ/FBX/RVT/IFC/DWG),内置 BIM 轻量化、CAD 解析、粒子系统、插件系统、动画编辑器。在线可用,2.4K stars,WebGPU 支持在路上。 - [长视野 Agent 综述:人大团队用两大支柱重新定义 AI Agent 的演化路线图](https://blog.mushroom.cv/blog/awesome-long-horizon-agents-ruc-nlpir-survey-harness-optimization/): RUC-NLPIR 发布 Awesome-Long-Horizon-Agents,配套综述「Towards Long-Horizon Agents: A Survey」。核心框架:Agent = 基础策略 + Harness,两大支柱(外化 Harness 工程 + 内化模型优化)、三层任务难度(H1/H2/H3)、三阶段演化史(Prompt→Context→Runtime)。873 stars,MIT 开源。 - [Frontis-MA1:清华 + Horizon Research 开源 AI 改进 AI 的全套配方,35B 单卡超 GPT-5.5](https://blog.mushroom.cv/blog/frontis-ma1-openrsi-ai4ai-recursive-self-improvement-mle/): FrontisAI/OpenRSI 是 Frontis.AI + 清华大学的 AI4AI 开源框架。核心是 Frontis-MA1(35B/30B),通过四个可训练原子算子(Draft/Improve/Debug/Crossover)+ OpenMLE 全栈,在 MLE-Bench Lite 单卡 12h 达到 71.21% Medal Average,超越 GPT-5.5 + Codex。CC BY-NC 4.0,模型+数据+代码全开源。 - [World Monitor:一个人几天做出 Palantir 战情室的开源平替,78K stars](https://blog.mushroom.cv/blog/worldmonitor-elie-habib-palantir-gotham-open-source-alternative-3d-globe/): Elie Habib 独自开源了 World Monitor(koala73/worldmonitor),一个对标 Palantir Gotham 政府级战情室的实时全球情报仪表盘。3D 地球仪、500+ 新闻源、15 类 AI 摘要、本地 Ollama 无 API Key,AGPL-3.0。78K stars,Tauri 桌面应用,6 个主题变体。 - [Godogen:用 Claude Code 一句话生成完整游戏,支持 Godot/Bevy/Babylon.js](https://blog.mushroom.cv/blog/godogen-ai-game-generator-claude-code-godot-bevy-babylon/): htdt/godogen 是基于 Claude Code / Codex 打造的全链路 AI 游戏生成流水线。描述一个游戏,Agent 自动构建项目、生成资产、运行引擎、并用运行中的游戏证明结果。支持 Godot 4(C#)、Bevy(Rust)、Babylon.js(TypeScript),5.2K stars,MIT 协议。 - [HuggingFace Speech-to-Speech:一行安装本地语音助手,延迟低到像真人,驱动数千台机器人](https://blog.mushroom.cv/blog/huggingface-speech-to-speech-local-voice-agent-robot-pipeline/): huggingface/speech-to-speech 是一个低延迟、全模块化的本地语音 Agent 流水线(VAD → STT → LLM → TTS),兼容 OpenAI Realtime API。10.6K stars,Apache 2.0,`pip install speech-to-speech` 一行启动。已在数千台 Reachy Mini 机器人的对话后端中跑生产。每个组件均可替换,Apple Silicon 原生支持。 - [PenguinHarness:一句话让 Agent 自动构建 Agent,$0.02 生成完整 RAG 应用](https://blog.mushroom.cv/blog/penguinharness-deepseek-self-evolving-agent-builder-002-usd/): Prism-Shadow/penguin-harness 是一个开源 Agent 自动交付平台,TypeScript 编写,Apache-2.0。一句话描述需求,Agent 自动生成完整 Agent 应用(scaffold + 代码 + 运行说明)。接入 DeepSeek V4,数据分析精度全场最高,成本仅 Claude Code 的 1/70。内置 Agent 自进化:跑基准、找失分点、发布 N+1 版本。 - [TMax:AllenAI 最强开源终端 Agent RL 配方,9B 参数 Terminal-Bench 2.0 达 27%](https://blog.mushroom.cv/blog/tmax-allenai-open-rl-terminal-agent-training-recipe/): AllenAI 开源 TMax,目前最强的终端 Agent RL 训练配方。9B 参数模型在 Terminal-Bench 2.0 达到 27%,超越更大规模的闭源竞品。数据集 15K 任务,比此前最大终端 Agent 数据集大 2.5 倍,配套 SFT + DPPO RL 训练流程全套开源。 - [仅27B参数,微软开源Fara 1.5超越OpenAI Operator:完整电脑操作Agent技术解析](https://blog.mushroom.cv/blog/fara15-microsoft-computer-use-agent-27b-beats-openai-operator/): 微软 Research AI Frontiers 团队发布 Fara 1.5,提供 4B、9B、27B 三种规模的电脑操作 Agent 模型,全部 MIT 开源。Fara1.5-27B 在 Online-Mind2Web 基准拿下 72.3% 成功率,超越 OpenAI Operator(58.3%)和 Gemini 2.5 Computer Use(57.3%)。模型基于 Qwen3.5 构建,通过 FaraGen1.5 数据管道训练,权重已开放于 HuggingFace。 - [Mage-VL 跑在 Mac 上:微软视觉大模型的本地化部署,图片视频实时流式注释](https://blog.mushroom.cv/blog/mage-vl-local-mac-apple-silicon-image-video/): karlazx 发布了 mage-vl-local-mac,一个让 Microsoft Mage-VL 视觉语言模型在 Apple Silicon 上本地运行的社区项目。双击 setup.command 完成一键安装,FastAPI + React 浏览器界面,支持图片问答、视频问答(DCVC-RT 神经编解码器)和实时分段流式注释,全程本地推理,数据不出 Mac。 - [OpenPanels:给AI Agent装上本地可视化工作台,5个面板从写作到发布](https://blog.mushroom.cv/blog/openpanels-local-ai-agent-visual-workspace/): mooqii 开源了 OpenPanels,一个本地优先的 AI Agent 可视化工作台,用 Rust 写成,MIT 授权。5个面板覆盖从知识管理、文档写作到排版发布的全流程,内置微信公众号草稿集成,以 agent skill URL 的方式接入任何 AI Agent。 - [8K星 · 最小的 OpenID Certified™ 认证服务器:Tinyauth 全解析](https://blog.mushroom.cv/blog/tinyauth-smallest-openid-certified-auth-server-self-hosted/): tinyauthapp/tinyauth 是目前最小的 OpenID Certified™ 认证与授权服务器,Go 编写,AGPL-3.0。支持 OAuth/LDAP/访问控制,与 Traefik、Nginx、Caddy 无缝集成,Docker 一行启动。v5.1.0 于 2026 年 6 月通过 OpenID Basic OP 官方认证,8000+ GitHub stars。 - [img2threejs:给AI一张图,拿回一个可动的Three.js 3D代码](https://blog.mushroom.cv/blog/img2threejs-photo-to-threejs-code/): 16天 8591 星。img2threejs 给 Claude Code 加了一个 /img2threejs 技能:输入一张参考图,输出的不是 mesh 文件,而是纯 TypeScript 代码,从几何基元和程序化着色器重新建造这个物体,带运行时层级、可以直接动画。 - [OpenConnector:让AI Agent一次接入1000+个SaaS,不再操心OAuth](https://blog.mushroom.cv/blog/open-connector-saas-auth-gateway-ai-agents/): oomol-lab 开源了 OpenConnector,一个 AI Agent 专用的认证网关,Composio 的开源替代。接 1000+ SaaS 提供者、10000+ 预制 Action,凭据永远留在网关边界内,Agent 只能拿到执行结果。支持 SDK/CLI/MCP/HTTP 多接入方式,可部署到 Docker、Cloudflare Workers 或 Fly.io。 - [Persona:给AI语音助手装上一张会动的脸,通过MCP连接Codex](https://blog.mushroom.cv/blog/persona-vrm-avatar-ai-voice-mcp/): xikhar 开源了 Persona,一个跨平台桌面 VRM 角色应用,监听 Codex/ChatGPT 的音频输出,实时驱动嘴型同步和肢体动画。通过 MCP 暴露动画控制接口,AI Agent 可以直接调用 play_animation 让角色表达情绪。3天 680 星,MIT,支持 Linux/Windows/macOS。 - [om-ai-lab VLX三件套:让AI真正看懂、认准、导航物理世界](https://blog.mushroom.cv/blog/om-ai-lab-vlx-flow-seek-go-physical-ai/): om-ai-lab 发布 VLX-Flow、VLX-Seek、VLX-Go 三个模型,分别解决物理AI最核心的三个难题:流式视频理解、精准目标定位、轻量导航决策。0.6B 模型在追踪率上超越 7B 级选手,Linear Attention 让 TTFT 随流增长趋近水平线。 - [TurboFieldfare:在8GB MacBook上跑Gemma4 26B大模型,只用2GB内存](https://blog.mushroom.cv/blog/turbo-fieldfare-gemma4-26b-apple-silicon-2gb/): 一个开源 Swift + Metal 运行时,让 Gemma 4 26B-A4B 在任意 M 系列 Mac 上运行,包括 8GB 版本。核心思路:只把 1.35GB 共有权重驻留内存,从 SSD 流式读取每个 token 所需的 8 个专家——12GB 的专家文件按需拉取,实际内存占用 ~2GB。 - [WWDC26 正式讲了:Mac 本地跑完整 Agent Loop,四层技术栈手把手搭建](https://blog.mushroom.cv/blog/wwdc26-mlx-local-agentic-ai-mac-engineering-guide/): Apple MLX 团队在 WWDC26 Session 232 中讲透了在 Mac 本地运行 AI Agent 的完整技术栈:MLX → MLX-LM → MLX-LM Server → Agent 框架,三步起服务,六个开源框架横向对比,支持多 Mac 分布式推理。本文对原始 session 做深度解析,附完整工程落地代码。 - [Qoder Security:把安全审查内置进 AI 编程 Session,三层防护今日发布](https://blog.mushroom.cv/blog/qoder-security-ai-code-three-layer-defense/): Qoder 今日发布 Qoder Security,将代码安全审查从 CI 管道后置检查前移至编程 session 内。三层防护:L1 即时静态拦截、L2 语义污点分析、L3 跨文件数据流追踪,双 Agent 架构分离生成与审查。检测率提升60%,误报降低80%。 - [LobsterAI 普通人使用指南:网易有道出品,桌面 AI Agent 一句话搞定办公](https://blog.mushroom.cv/blog/lobsterai-guide-for-everyone/): LobsterAI 是网易有道开源的桌面 AI Agent(MIT,5500+ Star),支持 macOS 和 Windows,内置 28 个技能——建本地系统、做数据分析、生成 PPT/视频、浏览器自动化、股票研究,还能从微信/飞书/钉钉远程控制。本文是零基础普通人入门指南。 - [每个人都是自己的 FDE:读完北上深杭 125 人调查之后](https://blog.mushroom.cv/blog/self-fde-workbench-everyone-can-be-fde/): FDE 从 Palantir 走向全球,AI 落地失败率 95%,这个角色不该只属于大公司。 - [ChatCut × Codex:用 AI Agent 剪视频,提示词就是剪辑台](https://blog.mushroom.cv/blog/chatcut-codex-ai-video-editor-guide/): ChatCut 是一款 AI 视频编辑器,通过官方 Codex 插件把视频剪辑能力接入 OpenAI Codex Agent——输入一句话,Agent 自动完成字幕、动态图形、AI 配音、B-roll 生成、导出全流程。本文介绍产品全貌和入门使用方法。 - [Cloudflare Drop:拖一下文件夹,网站就上线了](https://blog.mushroom.cv/blog/cloudflare-drop-instant-deploy-guide/): Cloudflare 刚上线了 Drop(cloudflare.com/drop)——无需注册账号、无需任何配置,把 HTML/CSS/JS 文件夹或 ZIP 拖进去,网站立刻部署到 Cloudflare 全球网络。普通人用它上线网站的完整指南。 - [抽成从35%打到5%:AhaCreator 证明了什么,还能迁移到哪些行业](https://blog.mushroom.cv/blog/ai-intermediary-model-ahacreator-industry-transfer-guide/): AhaCreator 把海外达人营销的平台抽成从行业普遍的 25-50% 打到 5%,背后的逻辑不是补贴,而是 AI Agent 接管了 80-90% 的执行流程,彻底改变了成本结构。这个「AI 中介」模式的本质——用 AI 替代执行层、网络效应构建护城河、以极低佣金击穿传统竞争者——可以迁移到猎头、房产中介、供应链采购、PR 代理等几乎所有高度依赖人工执行的中介行业。 - [GraphMind:把代码库变成知识图谱,让 AI 永久记住你的架构](https://blog.mushroom.cv/blog/graphmind-code-knowledge-graph-agent-guide/): GraphMind(aouicher/graphmind,191★,MIT,Rust)是一个本地优先的代码知识图谱工具,通过 25 个 MCP 工具让 Claude Code、Cursor、Windsurf、Cline 等 AI 编程助手直接查询项目结构、调用链、死代码和跨项目依赖——无需重复索引,单次查询比 grep 少用 5700 倍 token。支持 30+ 语言,四层架构(结构图谱 + 语义向量 + 持久化记忆 + 跨项目关联),本地运行,无需上传代码。 - [12美元买入,25000美元卖出——普通人如何系统性寻找域名套利机会](https://blog.mushroom.cv/blog/domain-name-arbitrage-guide/): 一个域名从12美元涨到25000美元,回报超过2000倍。域名套利不是神话,但也绝非轻松。本文拆解普通人能操作的核心逻辑、找域名的工具方法,以及冷静面对风险的心态准备。 - [OpenMontage:33K Stars,把 AI 助手变成视频工作室,$1.33 出一条 60 秒动画](https://blog.mushroom.cv/blog/openmongage-ai-video-studio-guide/): calesthio/OpenMontage(33K★,AGPLv3)是世界首个开源 Agentic 视频制作系统,12 个管线、52 个工具、500+ Agent Skills。你用自然语言描述视频,Claude Code/Cursor/Copilot 帮你从研究、脚本、素材生成到配音配乐剪辑渲染全流程搞定。零 API key 可用,$1.33 出一条 60 秒 Pixar 风格动画。普通人完整使用指南。 - [paper2anything:丢一个 PDF,AI 帮你出五种学术宣传物料](https://blog.mushroom.cv/blog/paper2anything-agent-skills-academic-promotion-guide/): AI4GC Lab(浙大)开源的 Agent Skills 包 paper2anything(145★,Apache-2.0):把一篇学术论文 PDF 丢给 Claude Code,自动产出演讲 PPT、会议海报、项目主页、小红书帖子、公众号文章,五种材料全流程自动化,每种输出前都有子 Agent 盲审自查。科研人/研究生/实验室学术传播完整使用教程 + 实际案例展示。 - [织影 Video Production Buddy:AI 视频制作,每个阶段都要人工审批](https://blog.mushroom.cv/blog/video-production-buddy-zhiying-ai-pipeline-guide/): video-production-buddy/video-production-buddy(AGPLv3,Python)是一个强调人工管控的 AI 视频制作系统,中文名织影。和一键生成不同,它用 YAML 管线配置和 Markdown skills 把制作分成多个阶段(策划→脚本→素材→渲染→审查),每阶段都有审批门(Approval Gate)。Backlot 看板实时显示进度、花费和每个提供商决策,审批通过才能继续。适合对视频质量有要求、需要可溯源制作流程的用户。 - [Archify:用一句话描述系统,AI 生成可交互的架构图 HTML 文件](https://blog.mushroom.cv/blog/archify-tech-diagram-skill-guide/): tt-a1i/archify 是一个 AI Agent Skill(2502 Stars,MIT),支持 Claude Code、Codex CLI 和 opencode。你用自然语言描述系统架构或流程,它生成一个自包含 HTML 文件:内置深浅主题切换、一键复制 PNG、4× 高清导出(PNG/JPEG/WebP/SVG)。支持 5 类技术图:架构图、工作流、时序图、数据流、生命周期图。 - [Caveman:83K Star,让 AI Agent 省 65% Token 的神奇骚操作](https://blog.mushroom.cv/blog/caveman-ai-agent-token-reduction-skill/): Caveman 是一个 Claude Code/Codex/Cursor 的 skill 插件,83,000+ Stars,让 AI Agent 用「穴居人语言」回复(去掉废话、保留技术精度),节省 65% 的输出 Token,同时保持代码、命令、错误信息字节精确。JS 实现,MIT 开源,30+ Agent 支持,安装即生效。 - [html-video:丢一个链接,本地生成 MP4,全程不碰剪辑软件](https://blog.mushroom.cv/blog/html-video-nexu-usage-guide/): nexu-io/html-video 是一个本地视频生成工具,3744 Stars,Apache-2.0。丢入文章链接或 GitHub 仓库,AI 自动拆场景、套模板、渲染成 MP4。21 套商用 License 清理过的模板,底层用 HeyGen 开源的 HyperFrames 引擎,支持 Claude Code、Cursor、Codex 等 14 个 AI Agent。普通人快速上手指南。 - [Netcatty:3000 Star 的 AI 原生 SSH 终端管理器,程序员的新利器](https://blog.mushroom.cv/blog/netcatty-ai-ssh-terminal-manager-guide/): Netcatty 是一款 TypeScript 编写的开源 SSH 终端管理器,三天内突破 3000 Stars,内置 AI Agent「Catty」可用自然语言管理服务器、多主机编排,集成 SFTP 双面板、分屏终端和 Vault 文件浏览,是程序员替代 PuTTY/Termius 的现代选择。 - [Retrace:回放、分叉 AI Agent 运行记录,调试从此不再盲人摸象](https://blog.mushroom.cv/blog/retrace-ai-agent-debug-observability-tool/): Retrace 是 AI Agent 可观测性和调试工具,记录每一次 LLM 调用、工具调用和错误,支持运行记录的回放和分叉(fork),让 AI Agent 调试从黑盒变透明。免费版每月 1,000 次 trace,面向 Claude Code/Cursor/OpenHands 等独立开发者。 - [SparkLabs:首个 AI 原生游戏引擎,NPC 终于拥有了真正的大脑](https://blog.mushroom.cv/blog/sparklabs-ai-native-game-engine-intro/): SparkLabs 是首个 AI 原生游戏引擎,将 AI 深度集成进引擎核心架构:智能 NPC 有 10 维人格系统和情感状态机,神经渲染管线支持实时超分辨率,AI 叙事引擎自动生成分支剧情,多 LLM 支持包括 OpenAI、Anthropic、DeepSeek 和本地模型,并带有基于 React+TypeScript 的可视化编辑器。 - [Strix:34K Star 的开源 AI 自主渗透测试工具,能真正攻破你代码的 Agent](https://blog.mushroom.cv/blog/strix-ai-pentest-autonomous-hacker-guide/): Strix 是开源 AI 自主渗透测试工具,34,000+ Stars,多 AI 黑客 Agent 协作,自动发现漏洞并生成真实 PoC(不是误报),支持 CI/CD 集成、合规报告生成,Python 开发,Apache 2.0。从 OWASP Top 10 到 SSRF、RCE,AI 做完整渗透测试。 - [video-use:用 Claude Code 剪视频,browser-use 团队开源 AI 视频编辑器](https://blog.mushroom.cv/blog/video-use-ai-video-editor-claude-code/): video-use 是 browser-use 团队开源的 AI 视频编辑 skill,14,000+ Stars,支持 Claude Code/Codex/Hermes 等 Agent,自然语言描述剪辑任务,AI 自动剪掉填充词、自动调色、生成字幕、添加动画 overlay,通过 ElevenLabs 配音,输出 final.mp4。Python 开发,完全开源。 - [MultiPost:一个浏览器插件,一键同步发内容到 10+ 平台](https://blog.mushroom.cv/blog/multipost-extension-one-click-multi-platform-guide/): MultiPost 是开源免费的跨平台一键分发浏览器插件(2,700+ Star),无需 API Key、无需额外账号,复用浏览器已登录 session,支持小红书、微博、知乎、抖音、Twitter、LinkedIn、Instagram 等 10 余个平台同步发文。本文为普通内容创作者提供完整上手指南:安装、使用、风控注意事项。 - [我用 AI Agent 给自己搭了个每日情报看板,现在开源了](https://blog.mushroom.cv/blog/ai-intel-workbench-daily-dashboard-guide/): ai-intel-workbench 是一个本地优先的 AI 每日情报工作台:Agent 每天自动调研 5 个维度(大厂动态、KOL 观点、前沿论文、热门开源、AI×金融),沉淀成可视化 HTML 看板,可选推送到飞书/Lark 机器人,支持 Claude Code 和 Codex。本文手把手教普通人 10 分钟跑起来,以及如何越用越好用。 - [Viktor:10 周 $20M ARR,Slack 里的 AI 员工如何做到的](https://blog.mushroom.cv/blog/viktor-ai-employee-deep-dive-research/): 深度研究报告:Viktor(viktor.com)是一个住在 Slack/Teams 里的 AI 员工,口号「Not a tool. A hire.」,2026 年 2 月上线,10 周做到 $15M ARR,6 月突破 $20M ARR。Accel 领投 $75M A 轮,Slack 两位联创参投,团队仅 6 名工程师,几乎零销售。本文全面分析其产品架构、增长机制、客户画像与商业模式。 - [FramePack:ControlNet 作者开源,6G 显存生成 1 分钟视频,F1+P1 双版抗漂移](https://blog.mushroom.cv/blog/framepack-lllyasviel-long-video-diffusion-guide/): ControlNet 作者 lllyasviel(张吕敏)开源 FramePack(17K⭐,Apache 2.0),独创帧上下文打包技术将历史帧压缩为恒定长度,算力开销不随视频变长增长,6GB 显存可跑 13B 大模型生成 60 秒 30fps 视频。F1 前向生成,P1 新增规划抗漂移+历史离散化,大幅抑制超长视频画面跑偏。Gradio GUI,Windows 一键整合包,RTX 4090 开启 TeaCache 可达 1.5 秒/帧。 - [act-combat-design:游戏战斗策划开源 AI Skill,46 元规则 + 70+ 游戏库,三端全兼容](https://blog.mushroom.cv/blog/act-combat-design-ai-skill-guide/): 资深游戏战斗策划 koisama0411 开源 act-combat-design,一套项目无关的 AI 战斗设计 Skill,覆盖角色/Boss 设计、招式集、数值验证到审阅级 HTML 文档产出。内置 46 条元规则、70+ 游戏借鉴库、两个虚构示例项目,Claude Code 安装后说'设计XXX角色'即自动触发。 - [Agent Skills:Google 工程师 67K 星,24 Skill + 8 命令覆盖完整研发链路](https://blog.mushroom.cv/blog/addy-agent-skills-google-engineering-guide/): Google Chrome Engineering Manager Addy Osmani 开源 agent-skills(67K⭐),将谷歌软件工程规范(Hyrum定律、Beyonce规则、Chesterton栅栏等)封装为 24 个 Skill + 8 条命令,覆盖 DEFINE→PLAN→BUILD→VERIFY→REVIEW→SHIP 完整开发链路,兼容 Claude Code / Cursor / Gemini CLI / Windsurf,两行命令即可安装。 - [Aham Voice:Mac 本地会议录音,转写+说话人分离全离线,纪要接自己的大模型](https://blog.mushroom.cv/blog/aham-voice-meeting-recording-guide/): Aham Voice 是一款 macOS 本地优先的会议录音转写工具(MIT 开源):FunASR 离线转写 + CAM++ 说话人分离 + emotion2vec 情绪标注全部本地跑,音频不上传;会议纪要接你自己的 OpenAI 兼容大模型 API,Key 只存本机。适合任何不想把录音上传到陌生服务器的 Mac 用户。 - [《Agentic AI 漫游指南》:最完整的 Agent 全栈工程书,MCP/A2A/RAG 全覆盖](https://blog.mushroom.cv/blog/hitchhikers-guide-agentic-ai-book/): Haggai Roitman 在 arXiv 发布《Agentic AI 漫游指南》(arXiv:2606.24937),这是一本覆盖 LLM 基础、RLHF/GRPO 对齐、RAG 记忆系统、MCP/A2A 多 Agent 协议到生产部署的完整工程参考书。核心论点:构建优秀 Agent 系统,需要理解每一层管线,不能只懂一层。 - [百度开源 Unlimited-OCR:一次扫完整本 PDF,票据单据智能化提速](https://blog.mushroom.cv/blog/unlimited-ocr-baidu-document-parsing-guide/): 百度开源 Unlimited-OCR(11K⭐,MIT),提出 Reference Sliding Window Attention(R-SWA)彻底解决长文档解析的 KV Cache 爆增问题:一次推理可扫完数十页 PDF,KV Cache 全程恒定不增长。支持 Transformers / vLLM / SGLang,对发票、合同、银行流水、报销单等商业票据的批量智能化处理具有决定性加速作用。 - [arle 实战指南:普通笔记本一键跑本地大模型,再用蒸馏让 4B 模型追上 35B 的推理能力](https://blog.mushroom.cv/blog/arle-local-llm-distillation-guide/): arle 是纯 Rust 编写的本地 LLM 运行时,一个二进制文件搞定 OpenAI 兼容服务、本地 Agent 和在线蒸馏训练。MacBook M4 Pro 上 35B MoE 跑出 85 tok/s;用 OPD 蒸馏后 4B 模型在 MATH-500 上提升 27 个百分点。本文从模型玩家视角梳理完整上手流程。 - [InfiniteDiffusion:一个人、一张消费级显卡、一篇 SIGGRAPH 2026 顶会论文](https://blog.mushroom.cv/blog/infinitediffusion-terrain-generation-guide/): Alexander Goslin 以独立研究者身份,用 RTX 3090 Ti 发表 SIGGRAPH 2026 论文 InfiniteDiffusion,将扩散模型改造为懒惰采样,实现无界、O(1) 随机访问、确定性的无限地形生成。本文整理复现路径与游戏/工程应用方向。 - [LilBot-agent 试用手记:用 Python 把本地 AI 塞进一个全屏驾驶舱](https://blog.mushroom.cv/blog/lilbot-agent-local-coding-trial/): LilBot-agent 是纯 Python 开源本地编码 Agent,Windows 优先,原生适配 DeepSeek 等 OpenAI 兼容模型,内置全屏 TUI 驾驶舱、多子代理/Team 协作、五层权限沙箱、持久化记忆、MCP 外部工具对接,153 Stars,本文从开发者试用视角逐层拆解。 - [Ornith-1.0:自搭脚手架 AI,9B 打赢 Gemma4-31B,397B 超越 Claude Opus 4.7](https://blog.mushroom.cv/blog/ornith-1-agentic-coding-self-scaffold-guide/): DeepReinforce 开源 Ornith-1.0 系列:9B / 35B MoE / 397B MoE,专攻 Agentic Coding。核心创新是自搭脚手架 RL——让模型学会给自己写工作流,而不是人工设计固定 harness。397B 在 Terminal-Bench 2.1 和 SWE-Bench Verified 双超 Claude Opus 4.7,35B MoE 反超参数大 10 倍的 Qwen3.5-397B。 - [VibeThinker-3B 拆解:微博团队如何用 7800 美元训出打赢 DeepSeek R1 的小模型,以及你能复刻什么](https://blog.mushroom.cv/blog/vibethinker-small-model-training-guide/): 微博AI团队开源的VibeThinker系列用「频谱到信号」训练范式,让1.5B小模型在数学竞赛上超越400倍大的DeepSeek R1,训练成本仅7800美元。本文拆解其完整训练管线SSP,分析如何模仿这套方法训练你自己的专项小模型。 - [LFM2.5-230M 开发者探索指南:213 tok/s 的小模型,普通人能做什么?](https://blog.mushroom.cv/blog/lfm2-5-230m-small-model-developer/): Liquid AI 开源的 LFM2.5-230M 在手机 CPU 上跑出 213 tok/s,Raspberry Pi 上 42 tok/s,支持 32K 上下文和 Tool Use。本文从 6 个方向拆解普通开发者可以用它做什么:端侧 Agent、浏览器推理、Android App、低成本微调、IoT 部署和多 Agent 协作。 - [Webclaw 开发者使用指南:用 Rust 爬虫给 AI 喂干净的 Markdown](https://blog.mushroom.cv/blog/webclaw-rust-web-scraper-llm-guide/): Webclaw 是一款 Rust 编写的本地优先网页内容提取工具,MCP 一键接入 Claude/Cursor,自动去噪输出 LLM 专用 Markdown,支持单页抓取、全站爬虫、批量爬取、页面对比、品牌元素提取,AGPL-3.0 开源,1500+ Stars。 - [非得显卡?小模型跑在 CPU 上也照样快:Aether 小模型运维 Agent 全解析(转载)](https://blog.mushroom.cv/blog/aether-small-model-cpu-ops-agent/): 转载自阿里云开发者社区(作者:小伟 tiger)。Aether 项目聚焦边缘 / No-GPU / 私有化场景,用 ≤9B 小模型(qwen2.5:1.5b)+ RAG(ChromaDB + bge-large-zh + bge-reranker-v2-m3)+ 分级路由 + SOP Skill + LoRA 微调,构建可在 CPU 上跑的高可用智能运维 Agent。文末附 Mycelium 整理的相关开源仓库(06-Aether / 08-train-slm / 10-Aether-Skills / Nanobot)核心摘要与点评。 - [FanBox 深度拆解:AI 时代的 Coding 驾驶舱,786 Stars 背后的设计哲学](https://blog.mushroom.cv/blog/fanbox-coding-agent-cockpit/): FanBox 是花叔开源的 Coding Agent 驾驶舱,用一个窗口解决「AI 帮你起了十个项目、然后全找不到了」的真实痛点。本文深度拆解它的五大功能模块、技术架构、三套皮肤设计哲学,以及「5 subagent 验收」的独特开发方法论。 - [拆解 Fireworks AI:4 年做到 150 亿美金估值,护城河到底在哪?](https://blog.mushroom.cv/blog/fireworks-ai-moat-deep-dive/): Fireworks AI 用 4 年从 0 做到 ARR 8 亿美金、估值 150 亿美金在谈,每天处理 10 万亿 token。本文深度拆解它的五大护城河——从 PyTorch 全建制团队、FireAttention 自研内核,到 FireOptimizer 优化栈,并提炼给 AI 创业者的五条启示。 - [光岛:一触即发的桌面工作岛,普通人和开发者都能用](https://blog.mushroom.cv/blog/luma-island-desktop-work-island/): 光岛(luma-island-builder)是一个 Codex Skill,引导你用对话生成一个桌面边缘的小工作台——打开常用链接、复制资料、记录待办、运行脚本,一键触达,无需任何启动成本。 - [把安卓模拟器装进 Docker:docker-android 容器化模拟器入门与 CI 自动化测试指南](https://blog.mushroom.cv/blog/docker-android-containerized-emulator-ci-guide/): docker-android(6.3k★,MIT)把安卓模拟器打包成一个基于 Alpine 的轻量容器服务:支持 KVM/GPU 硬件加速、可自定义 Android API 版本与镜像类型(含 Play 商店)、无头后台运行、内置 ADB 5555 端口转发、配合 scrcpy 远程投屏;重启默认清空数据,也可挂载 /data 持久化,docker-compose 一键编排。本文从零基础角度讲清楚它是什么、怎么跑、怎么接入 CI 做批量兼容性测试。 - [本地就能跑的 Agent 平台:OpenMaple 自托管 managed-agent 控制面入门](https://blog.mushroom.cv/blog/openmaple-local-managed-agent-platform-guide/): OpenMaple(Apache-2.0 开源)是一个能在本地一键跑起来的 managed-agent 控制面:它把内部 Agent 平台常见的能力拆成一套资源模型——Agent、Environment、Session、Vault、Runtime Pool、Sandbox Pool、Event Log,外加 SDK / CLI / REST API。一条 setup-local-docker.sh 起 Web(8080)、API(27951)、MySQL、本地 Docker 运行池与沙箱池,默认不需要 E2B/veFaaS/OAuth,只有跑真实模型 loop 才要模型 key。本文从零基础角度讲清楚它是什么、资源模型怎么串、怎么本地试用。 - [Seeder:自托管项目管理工具,原生支持 MCP,让 AI 直接读写你的任务](https://blog.mushroom.cv/blog/seeder-mcp-project-manager/): Seeder 是一个开源自托管项目管理工具,运行在 Cloudflare Workers 上,原生内置 MCP 服务器,让 Claude、Cursor 等 AI 助手直接读写任务和客户请求,所有操作完整记录在活动流中。 - [不会画画也能给文章配图:ian-xiaohei-illustrations 小黑手绘配图 Skill 入门指南](https://blog.mushroom.cv/blog/ian-xiaohei-illustrations-beginner-guide/): ian-xiaohei-illustrations 是一个能装进 Codex / Claude Code 的 Agent Skill:把你的中文文章交给它,AI 自动生成 16:9 白底手绘配图,主角是一只叫「小黑」的黑色小怪物。一句话触发、最多 8 张、红橙蓝语义批注、8 种构图模式。本文从零基础角度讲清楚怎么装、怎么用,并重点讲它最有意思的扩展玩法——把「小黑」换成你自己的形象。 - [把内容一次发到全平台:social-auto-upload 个人自动发布入门实测指南](https://blog.mushroom.cv/blog/social-auto-upload-multi-platform-publishing-guide/): social-auto-upload(12.7k★,Apache 思路开源)用本地浏览器自动化,把图文/视频一键发到抖音、小红书、B站、视频号、快手、YouTube,支持定时、无头运行、cookie 登录,无需逆向、无需常驻 Docker。本文是亲手安装实测后的入门指南:怎么装、怎么登录、怎么发,以及为什么它适合个人而非刷屏。 - [把 5 万元的品牌咨询装进 Claude:brand-strategy-guide 让小团队也能做品牌全案](https://blog.mushroom.cv/blog/brand-strategy-guide-claude-skill-for-startups/): brand-strategy-guide 是一个开源的 Claude Code 技能,把专业品牌咨询方法论变成一套可对话的 AI 系统。早期创业者不用花 1.5 万到 5 万美元请咨询公司,靠 22 轮结构化对话或一份问卷,就能产出 40-100 页的品牌全案。本文讲清它是什么、谁能用、怎么上手。 - [Apple 官方容器工具来了:一个容器一个 VM,Mac 本地开发的底层能力正在重写](https://blog.mushroom.cv/blog/apple-container-native-linux-vm-mac-silicon-guide/): Apple 正式开源了 container——一个用 Swift 写的原生 Linux 容器运行时,不依赖 Docker Desktop,直接调用 Apple Silicon 硬件虚拟化,每个容器拥有独立 Linux 内核。37k stars,v1.0.0 已发布。这篇文章带你看它的核心设计、和 Docker 的本质差异、以及现在值不值得用。 - [BLCaptain Meta Skill:把你反复讲给 AI 的那套经验,封装成一次安装、永久复用的 Agent Skill](https://blog.mushroom.cv/blog/blcaptain-meta-skill-agent-skill-creation-methodology/): 你有没有这种经历:每次打开新对话,都要重新把同一套 SOP、提示词、专家判断讲给 AI 听?BLCaptain Meta Skill 是一个开源方法论包,专门解决这个问题——帮你把重复工作流产品化为可安装、可验证、可迭代的 Agent Skill。它是 Codex 与 Claude Code 7 轮协同迭代的结果。 - [juju-content-illustrations:一个 Agent Skill,把你的长文章变成卷卷风格手绘插画](https://blog.mushroom.cv/blog/juju-content-illustrations-skill-ai-visual-content-guide/): 卷卷整理研究所 × 内容插画 Skill。一句话触发,AI 自动把文章、教程、方法论转成白底轻线稿的手绘卡片——主角是白色比熊卷卷,最多生成 10 张,支持 6 种比例,颜色有语义,场景有隐喻。60 stars,MIT 开源,可装进 Claude Code 或 Codex 直接用。 - [从像素到动效:Pixel2SVG-HTML + Pixel2Motion 如何把一张 Logo 截图变成可审查的品牌动画](https://blog.mushroom.cv/blog/pixel2motion-ai-logo-animation-pipeline/): nolangz 的两个开源 Codex/Claude skill 组成一条完整流水线:Pixel2SVG-HTML 把位图 logo 拟合成最低复杂度的语义 SVG,Pixel2Motion 在这份'终帧契约'上编排动画。本文深度分析它的核心理念——以矢量工艺取代盲目描摹、IoU 只做诊断不做闸门、每一步都留 QA 证据。 - [14天、5人,他们真的把AI编程助手整出来了](https://blog.mushroom.cv/blog/mimo-code-vibe-coding-era/): 罗福莉在推上官宣 MiMo Code 诞生——14天,5个人,一场 vibe-coding 之旅。加上 k佬 两天喝完一箱红牛重构 Kimi Code,2026年的AI编程工具战争,已经用「天」为单位在卷了。 - [OpenSquilla:同样预算,更高智能密度——开源 AI Agent 的 Token 效率革命](https://blog.mushroom.cv/blog/opensquilla-token-efficient-ai-agent-open-source/): OpenSquilla 是一个开源微内核 AI Agent 框架,通过本地 ML 路由器 SquillaRouter 将 token 开销降低 60-80%,同时支持 20+ 大模型供应商和四层认知记忆架构。 - [Paperclip:3 个月 69,462 star,匿名创始人,Zero Human Companies 到底是什么](https://blog.mushroom.cv/blog/paperclip-zero-human-companies-ai-agent-orchestration/): paperclipai/paperclip 深度调研:不是 Agent 框架,不是工作流构建器,是 AI Agent 团队的组织基础设施——带组织架构图、预算管控、治理审批的公司操作系统。一条命令上手,TypeScript MIT 开源。 - [Aippy:上线一年,估值2.5亿美金,AI游戏社区凭什么](https://blog.mushroom.cv/blog/aippy-ai-game-community-250m-valuation-analysis/): 赤子城孵化的AI游戏社区Aippy,2025年4月上线,2026年6月完成首轮融资,投后估值2.5亿美元。3百万下载、2百万MAU、50%日活、200万款UGC游戏——它的底层逻辑是把游戏创作变成了刷短视频一样的日常行为。 - [DeepMind Science Skills:开源AI Agent工具包,整合30+科学数据库加速科研](https://blog.mushroom.cv/blog/deepmind-science-skills-ai-agent-toolkit-scientific-discovery/): Google DeepMind 开源了 Science Skills——一套专为科学发现设计的 AI Agent 能力包,覆盖基因组学、蛋白质结构、药物发现等领域,对接 AlphaGenome、AlphaFold、UniProt 等 30+ 数据库,用 SKILL.md 格式实现 53-92% 的 token 节省。 - [Gemma 4 12B:无编码器多模态,原生音视频理解,16GB 笔记本可跑](https://blog.mushroom.cv/blog/gemma4-12b-encoder-free-multimodal-audio-video-understanding/): Google DeepMind 发布 Gemma 4 12B Unified——首个中等规模无编码器多模态开源模型,原生支持文本、图像、音频、视频四模态输入,256K 上下文,GPQA Diamond 78.8%,16GB 显存即可本地运行,Apache 2.0 开源。 - [Open Design:58K star 开源设计工具,对比 Claude Code 设计能力的深度分析](https://blog.mushroom.cv/blog/open-design-nexu-open-source-claude-design-alternative/): nexu-io/open-design 是 Claude Design 的开源替代:本地优先原生桌面应用,259+ Skills、150+ DESIGN.md 设计系统、261 插件,支持 21 种 AI 代理 CLI 包括 Claude Code。本文深度对比 Open Design 与 Claude Code 原生设计能力的优缺点,并给出选型建议。 - [Replit 的 13 个月:从差点死掉到 2.53 亿,创业底层逻辑](https://blog.mushroom.cv/blog/replit-13-months-from-near-death-to-253-million-arr/): 2024年5月,Replit几乎被放弃。同年9月Agent上线,13个月后年收入2.53亿美元,增长2352%。很多人说这是赶上了AI风口。但扒开细节你会发现,Replit的爆发根本不是运气——而是8年打基础后,时代终于追上了它。 - [Cheese Paper:离线优先、无遥测、专为小说创作设计的开源文本编辑器,v1.0.0 发布](https://blog.mushroom.cv/blog/cheese-paper-creative-writing-editor/): Cheese Paper 是一款专为小说创作设计的离线开源编辑器,场景管理、角色卡、世界观数据库三合一,文件格式采用 Markdown+TOML,兼容任意文本编辑器和同步工具。GPLv3,无订阅,无遥测。v1.0.0 于 2026-05-30 发布,已上架 Flathub。 - [Rapid-MLX:Apple Silicon 最快本地 AI 推理,比 Ollama 快 4.2x,100% 工具调用](https://blog.mushroom.cv/blog/rapid-mlx-apple-silicon-local-ai-inference/): Rapid-MLX 是专为 Apple Silicon 优化的本地 LLM 推理引擎:0.08s 缓存首字延迟、100% 工具调用成功率、17 种工具解析器、提示缓存、推理分离、云端路由。兼容 OpenAI API,可直接与 Claude Code、Cursor、Aider 配合使用。2.6k Star,v0.6.71。 - [LiteParse:LlamaIndex 团队开源本地文档解析引擎,Rust 核心+四端绑定+精确边界框,8.3k Star](https://blog.mushroom.cv/blog/liteparse-llamaindex-local-document-parser/): run-llama/liteparse 是 LlamaIndex 团队推出的开源本地文档解析引擎:Rust 核心,原生支持 Node.js、Python、Browser WASM。基于 PDFium 的空间文本提取 + bounding box,双轨解析(native PDF + selective OCR),为 AI Agent 提供截图和布局信息,无云依赖,无隐私顾虑。v2.0.4,8.3k Stars。 - [AnySearch:专为 AI Agent 设计的搜索基础设施,打通金融、法律、学术认证数据源](https://blog.mushroom.cv/blog/anysearch-ai-agent-search-infrastructure/): AnySearch 于 2026 年 5 月 11 日上线,定位 AI 时代搜索基础设施:单一 API 接入 22 个垂直领域、9 种内容类型,覆盖金融终端、法律数据库、学术期刊等需要认证的专业数据源。支持 MCP、Claude Code 集成,20 天内 GitHub 1.9k Star。 - [GSAP 官方 AI Skill 包:教会 40 个编码 Agent 正确写动画,Webflow 收购后全插件免费](https://blog.mushroom.cv/blog/gsap-skills-official-ai-animation-skill/): GreenSock 官方在 GitHub 发布 gsap-skills,一套专为 AI 编程助手设计的 Skill 集合,支持 Claude Code、Cursor、Copilot、Codex、Windsurf 等 40+ Agent 工具,覆盖核心 API、时间轴、ScrollTrigger、React 集成、性能优化八大模块。6.3k Star。Webflow 收购后所有付费插件免费开放。 - [Sphere SDK:给 AI Agent 发身份、钱包和直接结算能力,Agent 经济底层基础设施来了](https://blog.mushroom.cv/blog/sphere-sdk-autonomous-agent-economy-infrastructure/): unicity-sphere/sphere-sdk 是一套给自主经济 Agent 发密码学身份、Bearer Token 钱包和 P2P 结算能力的 TypeScript SDK。Bearer Token 作为可携带密码学对象在 Agent 间直接流转,只有承诺上链;Nostr 加密通信;v0.8.0 包含 178 个 PR、914 个单元测试全绿。 - [字节开源 Lance:3B 参数搞定图像视频六合一,VBench 登顶统一模型榜](https://blog.mushroom.cv/blog/lance-bytedance-3b-multimodal-unified/): 字节跳动智能创作实验室开源 Lance:3B 激活参数,统一支持图像理解/生成/编辑与视频理解/生成/编辑六项任务。GenEval 0.90 并列第一,VBench 85.11 登顶统一模型,Apache 2.0 开源。 - [Capafy:你的 AI 技能可以作为产品出售,在你睡觉时帮你赚钱](https://blog.mushroom.cv/blog/capafy-ai-skill-marketplace-agent-economy/): Capafy 是一个刚上线的 AI 技能市场,开发者可以上传在 Claude Code、Codex 或 OpenClaw 中构建的 Agent 技能,设置按小时、订阅或一次性付费定价,每次有人使用就获得收益,代码和 Prompt 对用户完全不可见。 - [MOSS-TTS v1.5:31 种语言、显式停顿控制、更稳的声音克隆,Apache 2.0 开源](https://blog.mushroom.cv/blog/moss-tts-v15-multilingual-voice-clone/): 复旦 NLP、上海创新研究院、模思智能联合的 OpenMOSS 团队发布 MOSS-TTS v1.5:31 种语言、[pause 3.2s] 显式停顿控制、声音克隆方差更小、标点韵律更自然,Apache 2.0 商用友好,PyTorch/GGUF/ONNX/MLX 全部支持。 - [这个开源 Agent 框架的核心设计,可能是目前最「聪明」的取舍](https://blog.mushroom.cv/blog/pi-agent-extension-design/): Pi Agent(badlogic/pi-mono)的扩展系统从架构第一天起就作为一等公民存在:核心只做最必要的事,剩下的全部交给扩展。转载自潘智祥。 - [FastMCP:用几十行 TypeScript 搭 MCP 服务器,5 个月 3000+ star](https://blog.mushroom.cv/blog/fastmcp-typescript-mcp-server-framework/): FastMCP 是 TypeScript 版 MCP 服务器框架,内置 Session 管理、OAuth 认证、Edge Runtime 支持和 CLI 调试工具,比官方 SDK 省去大量样板代码。5 个月获 3145 star,周均下载 46 万次。 - [微软开源 38 亿参数文生图模型 Lens,训练成本只要竞品的两成](https://blog.mushroom.cv/blog/microsoft-lens-text-to-image-model/): 微软发布开源文生图模型 Lens,仅 3.8B 参数却在多项基准上超越 Stable Diffusion 3 和 Flux,训练成本只要竞品的两成。 - [Dittofeed:开源的全渠道用户消息自动化平台,Customer.io 的免费替代](https://blog.mushroom.cv/blog/dittofeed-open-source-customer-engagement/): Dittofeed 是一个 MIT 授权的开源用户消息自动化平台,支持 Email、SMS、Push、WhatsApp 等多渠道,可视化旅程构建器 + 自托管部署,替代 Customer.io 和 OneSignal。 - [Stable Audio 3.0:6分20秒完整歌曲,四模型开源,本地 MacBook 就能跑](https://blog.mushroom.cv/blog/stable-audio-3-ai-music-generation-local/): Stability AI 于 2026 年 5 月 20 日发布 Stable Audio 3.0,最长生成 6 分 20 秒音乐,推出 Small/SFX/Medium/Large 四档模型,中小模型完全开源,支持音频修复续写,训练数据 100% 授权,与华纳、环球音乐集团达成合作。 - [CodeGraph:给 Claude Code 装一个代码知识图谱,省钱 35%、工具调用减少 70%](https://blog.mushroom.cv/blog/codegraph-claude-code-mcp-semantic-search/): CodeGraph 通过 MCP 协议为 Claude Code、Cursor 等 AI 编程助手提供本地代码知识图谱,跨 7 个真实项目基准测试显示平均节省 35% API 成本,减少 70% 工具调用次数,全程 100% 本地运行。 - [GitHub 爆火的 AI 编程技能包项目解析](https://blog.mushroom.cv/blog/local-ai-skill-kit/): GitHub 上一个 AI 编程技能包项目因实用性和易用性迅速走红。 - [【开源】Agent Game Forge:用 AI Agent 驱动 2D 游戏开发的本地 IDE](https://blog.mushroom.cv/blog/agent-game-forge-ai-2d-game-ide/): 123 Star 开源项目 Agent Game Forge(AGF)——本地优先的 2D 游戏 IDE,让 Codex 或 Claude Code 帮你从一句描述生成完整游戏。精灵图、parallax 背景、物理、场景编辑器全部内置,Apache 2.0 协议。 - [《Agentic Design Patterns》中文翻译项目解析](https://blog.mushroom.cv/blog/local-ai-design-patterns-guide/): 解析《Agentic Design Patterns》中文翻译项目及AI Agent设计模式 - [PaperSpine V2:新一代论文写作 AI 工具](https://blog.mushroom.cv/blog/research-paper-writing-tool-paper-spine-v2/): PaperSpine V2 支持多种 AI 环境,提升论文写作效率与结构化思考。 - [Godogen:一句话生成可玩游戏,Claude Code + Codex 的自动游戏开发流水线](https://blog.mushroom.cv/blog/godogen-autonomous-game-dev-godot-bevy-claude/): 3200+ Star 开源项目 Godogen,输入一句游戏创意,自动完成架构规划、代码编写、素材生成、引擎运行、截图检查、缺陷修复,最终交付完整的 Godot/Bevy 游戏项目。面向独立开发者和小团队的 AI 游戏工作室。 - [NVIDIA Sana 开发者落地指南:极轻量扩散模型集成与 Mac 本地部署实测](https://blog.mushroom.cv/blog/nvidia-sana-diffusion-developer-guide-mac/): Sana 0.6B 在笔记本显存不到 1 秒生成 1024×1024 图像,比 Flux-Dev 快 25 倍。本文覆盖核心资源、四大商业集成策略,以及 M3 Max 64GB Mac 的本地可行路径与 MLX 现状。 - [清华开源 Syll:不是聊天机器人,是住在你桌面角落的 AI 伙伴](https://blog.mushroom.cv/blog/syll-tsinghua-self-hosted-ai-companion-runtime/): 清华 SAGE 实验室开源 Syll,一个自托管 AI companion runtime。它不主动打扰你,却悄悄记住你未完成的事:定时早报、Markdown 技能包、GUI 工作流录制、桌面幽灵图标、多端收发消息。Python + FastAPI,pip 一行安装,本地 Ollama 或云端模型均可驱动。 - [Needle:2600 万参数,把 Gemini 的工具调用能力塞进手表和眼镜](https://blog.mushroom.cv/blog/needle-26m-function-calling-edge-ai-cactus/): Cactus Compute 开源的 Needle 把 Gemini 的 function calling 能力蒸馏进一个 2600 万参数的 Simple Attention Network(SAN),去掉 FFN 层,保留纯注意力,在手机/手表/眼镜级设备上达到 6000 tokens/s prefill 和 1200 tokens/s 解码。单轮工具调用优于 FunctionGemma-270m、Qwen-0.6B、Granite-350m。MIT 协议完全开源。 - [油管大神 Dan Koe:用 Reddit 做 SEO+GEO 的四步打法,恐怖在哪里](https://blog.mushroom.cv/blog/dan-koe-reddit-seo-geo-ai-overviews-4-steps/): Reddit 已成 AI 引用第二高频来源。Dan Koe 的四步打法把 Google 索引逻辑与 AI 摘取逻辑同时喂饱:Gemini 双维筛词 → 双栖型回复 → 技术三层标记 → 双线验证。关键数据:44.2% 的 AI 引用来自内容前 30%;静态 HTML AI 爬取成功率 94%,纯 JS 渲染仅 23%。 - [OpenAI 实时语音一小时花 $18,这两个开源模型让你不花一分钱](https://blog.mushroom.cv/blog/moshi-mini-omni-free-realtime-voice-vs-openai/): OpenAI 发布三款实时语音模型,定价可达每小时 $18——比很多私教还贵。Kyutai 的 Moshi 和 gpt-omni 的 Mini-Omni 是两个完全开源的端到端实时语音替代方案,本地运行,支持 Apple Silicon MLX,延迟低至 160ms。 - [Token 自由在加速:Redis 之父让你的 Mac 跑起 DeepSeek V4 Flash](https://blog.mushroom.cv/blog/antirez-ds4-deepseek-v4-flash-mac-metal-inference/): Redis 创始人 antirez 开源 ds4——一个专为 DeepSeek V4 Flash 打造的 Mac 原生 Metal 推理引擎。40,000 行 C 代码 + 17 个 Metal Shader,2-bit 非对称量化,磁盘 KV Cache 持久化,M3 Max 上生成速度 26 t/s,make 一下就能跑。 - [给 AI Agent 装一个 CMO 大脑:marketingskills 开源营销技能包](https://blog.mushroom.cv/blog/marketingskills-ai-agent-cmo-skill-pack-open-source/): coreyhaines31/marketingskills 为 Claude Code 等 AI Agent 提供 32+ 专业营销技能,涵盖 AI SEO/GEO 优化、CRO 转化漏斗、高转化文案框架、RevOps 增长工程,含 51 个零依赖 CLI 工具,可直连 Ahrefs、Google Ads、Mailchimp API。 - [Matt Pocock 新出的 /grill-with-docs:让 AI 真正理解你的项目语言](https://blog.mushroom.cv/blog/matt-pocock-grill-with-docs-skill-claude-code/): TypeScript 布道者 Matt Pocock 开源 /grill-with-docs skill,融合 /grill-me + /ubiquitous-language + 文档沉淀。AI 边问问题边实时更新 CONTEXT.md 和 ADR,让 Agent 用你项目的专属语言做设计评审。仓库 9K+ star。 - [PPT Master:AI 生成可编辑原生 PowerPoint,不再是一页页图片](https://blog.mushroom.cv/blog/ai-ppt-master-native-powerpoint/): PPT Master 是 Hugo He 开源的 AI PPT 生成项目,可从 PDF、DOCX、URL 或 Markdown 生成真正可编辑的原生 PPTX:形状、文本框、图表、页面切换和逐元素动画都保留为 PowerPoint 对象。 - [0.1B 参数跑满 20 种语言:MOSS-TTS-Nano 超轻量 TTS 开源](https://blog.mushroom.cv/blog/moss-tts-nano-ultralight-multilingual-tts-open-source/): OpenMOSS 开源 MOSS-TTS-Nano,0.1B 参数,纯 CPU 运行,48kHz 双声道输出,支持 20 种语言零样本声音克隆。单核 CPU(M4 MacBook Air)流畅推理,ONNX 运行无需 PyTorch,可嵌入浏览器扩展与边缘设备。 - [王炸:440MB 翻译模型打赢 Qwen3-32B,腾讯 HunyuanMT 开源了](https://blog.mushroom.cv/blog/tencent-hunyuanmt-hy-mt15-translation-model/): 腾讯开源 HunyuanMT(Hy-MT 1.5),通过 AngelSlim 压缩后仅 440MB,在 FLORES-200 XCOMET 翻译质量评测中超过 Qwen3-32B(65GB)。支持 33 种语言,可完全离线运行在手机上,专业翻译能力碾压通用大模型。 - [lil agents:住在 Mac Dock 上的 AI 桌面伴侣](https://blog.mushroom.cv/blog/lil-agents-macos-dock-ai-companion/): lil agents 是一个开源 macOS 应用,两个会走路的卡通角色 Bruce 和 Jazz 住在你的 Dock 上方,点击打开 AI 终端,支持 Claude Code、OpenAI Codex、GitHub Copilot、Google Gemini,完全本地运行,无数据收集。 - [本地跑、带人声、免费开源:ACE-Step 1.5 是目前最像产品的本地音乐 AI](https://blog.mushroom.cv/blog/ace-step-15-local-music-generation-suno-alternative/): ACE-Step 1.5 + ace-step-ui 组合,正在成为 Suno 的本地开源替代方案:免费、完全本地、支持带人声完整歌曲生成,配套 UI 让普通人也能上手。本地 AI 音乐生成终于开始长出产品体验了。 - [Claude Code Game Studios:把 AI 对话窗口变成游戏工作室](https://blog.mushroom.cv/blog/claude-code-game-studios-open-source-framework/): CCGS 是一个开源框架,用 48 个专业 Agent、72 种工作流指令和分层协作架构,把 Claude Code 从单一对话工具变成具备专业级协作能力的虚拟游戏工作室,支持 Godot 4、Unity 和 UE5。 - [告别静态技能库!阿里发布 SkillClaw,开启 AI Agent「集体进化」时代](https://blog.mushroom.cv/blog/beyond-static-skill-libraries--alibaba/): 阿里 AMAP-ML 团队发布 SkillClaw 框架,通过 Agentic Evolver 自动聚合用户交互轨迹、更新共享技能库,让 AI Agent 实现集体进化。论文于 4 月登顶 HuggingFace 论文榜,6 轮进化后 Creative Synthesis 任务相对提升 88.41%。 - [Bloomberg终端免费平替——FinceptTerminal](https://blog.mushroom.cv/blog/finceptterminal--open-source-bloomberg-terminal-alternative/): FinceptTerminal 是一款由 C++20 驱动的开源专业级金融分析平台,GitHub 6.5k Stars,集成 QuantLib、37 个 AI 投资 Agent 和 100+ 数据源,被公认为彭博终端的免费平替。 - [DeepSeek V4 到来之后的 Vibe Coding 变化评估](https://blog.mushroom.cv/blog/deepseek-v4-vibe-coding-market-impact/): 2026年4月24日 DeepSeek-V4 正式发布:1M上下文、1.6T参数、V4-Flash输出仅¥2/M token。本文分析其对 Cursor、Copilot、Claude Code 等 Vibe Coding 工具市场的价格冲击与结构性重塑。 - [Hermes Agent 的「自动技能工厂」:让 AI 越用越聪明的元技能插件](https://blog.mushroom.cv/blog/hermes-skill-factory-auto-skill-generator/): hermes-skill-factory 是为 Hermes Agent 打造的元技能插件:被动观察你的工作流,自动生成可复用的 SKILL.md 和 plugin.py,让 AI 从「一次性工具」进化为「越用越懂你」的专属助手。 - [支持多种模型的开源 Agency Agents:50+ 专业 AI 角色,触手可及的完整 AI 代理机构](https://blog.mushroom.cv/blog/agency-agents-opensource-multi-model/): 深度解析 msitarzewski/agency-agents:9个部门、50+专业AI角色,从前端巫师到安全审计员,直接集成 Claude Code、Cursor、Copilot,将AI从「通用助理」升级为「专业协作网」。 - [GitHub 趋势月报:AI 工具从「多了」到「熟了」的三条成熟线](https://blog.mushroom.cv/blog/github-trending-monthly-analysis-2026/): 持续观察 GitHub Trending 一个月后的深度总结:Agent 工程化、入口外扩、垂直化三条主线,正在彻底重塑软件开发和工作流。 - [Kimi K2.6 发布:从长文本到 300 个 Agent 并行的战略跃迁](https://blog.mushroom.cv/blog/kimi-k2-6-agent-swarm-release/): 月之暗面正式发布并开源 Kimi K2.6:13小时不间断编码、300个子Agent并行、4000协作步骤,标志着 Kimi 从「长文本大模型」向「长程任务执行与Agent集群」的战略转型。 - [HarnessKit:管理你所有 AI Agent 的 Skill/MCP/Plugin/Hook](https://blog.mushroom.cv/blog/harnesskit-agent-skill-manager/): Agent 多、Skill/MCP/Plugin/Hook 分散难管理?HarnessKit 帮你一键搞定!集中式桌面工具,统一管理所有 AI Agent 的扩展、配置、记忆与规则。 - [个人AI工作台:Onyx——开源的团队AI知识中枢](https://blog.mushroom.cv/blog/onyx-ai-platform-161403/): Onyx 是一个开源 AI 平台,连接 40+ 数据源,集成 RAG 检索、多模型兼容、AI Agent 自动化与企业级自托管,让 AI 真正融入个人和团队的日常工作流。 - [Cloudflare Agents Week:为 AI 智能体时代重构互联网基础设施](https://blog.mushroom.cv/blog/cloudflare-agents-week-infrastructure/): Cloudflare 智能体周开篇致辞核心解读:从容器到 Isolates,从一对多到一对一,探索 AI 智能体时代的基础设施变革 - [亲测可用!用 GitHub CLI 一键呼叫 Copilot Code Review](https://blog.mushroom.cv/blog/gh-copilot-code-review-cli/): GitHub CLI v2.88.0 新功能实测:在终端直接邀请 Copilot 审查 PR,无需跳转浏览器,附隐私风险提示 - [Hyper-Extract 概要介绍](https://blog.mushroom.cv/blog/hyper-extract-knowledge-extraction-framework/): 由大语言模型驱动的智能知识提取与演化框架,支持从简单列表到复杂知识图谱的一站式知识抽取 - [VoxCPM 2 vs Sherpa-ONNX:语音AI开源双雄深度对比](https://blog.mushroom.cv/blog/voxcpm2-vs-sherpa-onnx-voice-ai-comparison/): 深度解析两款重磅语音AI开源项目:高保真语音生成模型 VoxCPM 2 与极致推理速度框架 Sherpa-ONNX - [从简单的语音输入开始的本地模型:Sherpa-ONNX与BreezeApp深度解析](https://blog.mushroom.cv/blog/sherpa-onnx-breezeapp-local-ai-voice/): 探索如何在本地设备上实现语音AI交互,详解 Sherpa-ONNX 语音处理框架与 BreezeApp 端侧大模型应用 - [MemPalace:重塑 AI 记忆的记忆宫殿](https://blog.mushroom.cv/blog/mempalace-ai-memory-palace/): MemPalace 是一个开源 AI 长期记忆系统,从古希腊记忆宫殿技术中汲取灵感,解决了当前 AI 助手会话后失忆的问题。 - [OpenScreen:免费开源的 Screen Studio 替代品](https://blog.mushroom.cv/blog/openscreen-free-screen-recorder/): 无需39美元每月,立刻获得智能缩放、鼠标跟随等专业录屏功能!OpenScreen是一个完全免费、跨平台的屏幕演示视频制作工具,被视为商业软件 Screen Studio 的开源替代方案。 - [Slack-Term:程序员专属的终端版 Slack 客户端](https://blog.mushroom.cv/blog/slack-term-terminal-slack-client/): slack-term 是一个专为程序员和终端爱好者设计的开源工具,允许直接在终端中使用 Slack,轻量快速,支持 Vim 快捷键操作。 - [apfel: 在 Apple Silicon Mac 上零成本调用本地 Apple Intelligence](https://blog.mushroom.cv/blog/apfel-apple-silicon-local-ai/): apfel 是一款开源 CLI 工具,让开发者在 Apple Silicon Mac 上直接调用 Apple Foundation Model,无需 API Key、完全本地化运行。 - [LLM Wiki:Karpathy 提出的知识管理新范式](https://blog.mushroom.cv/blog/llm-wiki-karpathy-knowledge-management/): Andrej Karpathy 发布 LLM Wiki 构思文件,提出从传统 RAG 到「会进化的 Wiki」的新范式,让 LLM 成为知识的组织者而非单纯的检索器。 - [AutoAgent:首个自优化智能体开源库](https://blog.mushroom.cv/blog/autoagent-self-optimizing-agent/): AutoAgent 是全球首个专注于"自优化"的开源智能体框架,推动 AI 从"手动调教"向"自主进化"跨越。在 SpreadsheetBench 和 TerminalBench 双双登顶。 - [Codexbar: Stop Losing Context When Switching Accounts](https://blog.mushroom.cv/blog/codexbar-macos-menu-bar-tool/): macOS menu bar tool solves multi-account switching pain: keep unified ~/.codex history pool, switch provider without losing sessions, local token usage stats. - [Codexbar 发布:不再为切账号丢失上下文而烦恼](https://blog.mushroom.cv/blog/codexbar-switch-account-context/): macOS 菜单栏工具解决多账号切换痛点:保留统一 ~/.codex 历史池,切换 provider 不丢 session,本地统计 token 用量。 - [Gemma 4 发布:本地开源模型的新标杆](https://blog.mushroom.cv/blog/gemma-4-released--a-new-benchmark-for-local-open-source-mode/): Google DeepMind 发布 Gemma 4,支持原生多模态、256K 长文本、Agent 友好,开源模型也能媲美闭源旗舰 - [别追AGI了!LeCun团队:人类本来就不通用](https://blog.mushroom.cv/blog/sai-superhuman-intelligence/): LeCun最新论文直面AGI迷思:人类智能从未真正通用。从Moravec悖论到SAI框架,AI的未来不是模仿人类,而是在专业领域实现超人类性能。 ## Progress-Report - [AirAccount 合约 v0.17.2-beta.3:把地基打扎实,为主网做准备](https://blog.mushroom.cv/blog/airaccount-contract-v0-17-2-beta3-release/): beta.3 不加新功能,只做一件事:把代码底座整理干净。链上版本自检、消除重复逻辑、错误信息更友好、安全防护更严、测试覆盖更全——679 条 Forge 测试,零失败。这是一个团队认真对待未来的信号。 - [AirAccount KMS Beta2(v0.20.0)发布:私钥永不出 TEE,NXP 真机 34/34 端测通过](https://blog.mushroom.cv/blog/airaccount-kms-beta2-v0-20-0-release/): AirAccount KMS Beta2 完成完整安全审计(P0/High 全修)、RPMB 硬件反回滚、SuperPaymaster 三个便利签名端点、NXP FRDM-IMX93 真机 34/34 E2E 覆盖。私钥永不出 TEE,每次签名需要实时防重放的 WebAuthn ceremony。 - [SuperPaymaster v5.3.3-beta.3:首次公开发布——让用户永远不用操心 Gas 费](https://blog.mushroom.cv/blog/superpaymaster-v5-3-3-beta3-gasless-infrastructure/): SuperPaymaster 是 AAStar 生态的去中心化 Gas 赞助基础设施。社区运营者用自己的 xPNTs 代币为用户代付链上 Gas,用户无需持有 ETH。人类与 AI Agent 双通道赞助,8 项安全审计修复,968 条测试全绿,Sepolia 首次公开发布。 - [Agent24:让你的个人 AI Agent 24 小时在线、自我进化](https://blog.mushroom.cv/blog/agent24-self-evolving-personal-agent-framework/): Agent24 是一套为「个人 AI Agent」设计的模块化跨平台框架:Electron 壳 + 可插拔能力模块 + 多 AI 适配 + 分层记忆 + SkillClaw 风格自进化引擎。本文介绍它的设计理念、架构与技术决策,作为项目启动声明。 - [iDoris 立项思考:一个普通研究者如何构建可持续进化的本地 AI 模型](https://blog.mushroom.cv/blog/idoris-project-launch--how-an-independent-researcher-builds-/): iDoris 是面向「个人→社区→城市」三层场景的本地 AI 模型项目。本文从约束推导出「必须分层+必须联邦」的结论;选定 Qwen3.5/3.6 同基座+分层 LoRA 架构;以 DP-SGD+算法可审计实现「权重可上传+原始数据不出本机」。我们不回避不确定性。 - [Agent Speaker 进度汇报:用 Nostr 构建个体+AI 的自组织协作网络](https://blog.mushroom.cv/blog/agent-speaker-progress-report-155926/): Agent Speaker + Relay:基于 Nostr 协议和 Mycelium,为每一个个体和 AI Agent 提供去中心化的发现、通信与协作能力。无平台垄断,自发自组织,跨越物理边界。Phase 1 已完成,Phase 2 进行中。 ## DN - [五大城市OPC政策深度解析:杭州、上海、深圳、苏州、北京](https://blog.mushroom.cv/blog/five-cities-opc-deep-analysis/): 2025-2026年,杭州、上海、深圳、苏州、北京五城集中发布OPC政策,形成最激烈的第一梯队竞争。本文逐城逐区拆解政策细节,提炼共性规律,并以此为镜系统评估资阳DNβ的差异化定位。 - [从大理到清迈,我在寻找什么](https://blog.mushroom.cv/blog/nomad-dali-chiangmai-dnbeta/): 离职之后,我走过大理、清迈,最后来到资阳DNBeta。这不是一篇旅行笔记,而是关于一个数字游民在寻找什么,以及为什么一座四川内陆小城的实验让我眼前一亮。 - [一人公司的AI员工:OPC创业者的Agent工具全景](https://blog.mushroom.cv/blog/opc-agent-frameworks-2026/): 当AI Agent从实验室走向生产,一个人指挥十个AI员工已成现实。本文分析OPC与AI Agent的关系,梳理GitHub最受欢迎的15个Agent框架,给出OPC创业者的选型决策树和能力清单。