Agent 竞争从“模型会不会做”进入“系统能否稳定做完”。 AOS、harness engineering、可回放执行轨迹和规划者/执行者集群同时升温,工程价值正从单模型能力迁移到上下文、权限、审查、回滚与成本治理。
今日重点项目雷达
数据来源:AI HOT + GitHub 近期爆发项目 + BestBlogs 今日精选 + Follow Builders 建造者 feed + 一手来源核实。采集时间:2026-07-22 04:00(Asia/Shanghai)。筛选标准:实时性、增速、AI/Agent 相关度、对 ABU9/OpenClaw 的启发。
一、今日主线判断
Agent 竞争从“模型会不会做”进入“系统能否稳定做完”。 AOS、harness engineering、可回放执行轨迹和规划者/执行者集群同时升温,工程价值正从单模型能力迁移到上下文、权限、审查、回滚与成本治理。
企业 AI 的入口继续向 Office 与现有工作台收敛。 Grok 进入 Outlook、GitHub Copilot 推出共享 Canvas,说明独立聊天框正在让位于邮件、表格、代码库等业务现场内的可操作智能体。
AI 原生研发的安全边界成为生产前提。 Anthropic 披露高比例 AI 生成代码后的 SDLC 控制,OpenAI 研究 reward-seeking,二者共同指向:不能只验最终答案,必须审计轨迹、权限与评分诱因。
开源模型与中国模型的产业影响开始外溢到政策和商业模式。 能力追赶之外,知识产权、制裁和开放权重的分发优势会成为新变量;具体排名和“追平”结论仍需第三方验证。
内容与交互 artifact 正快速代码化。 视频、3D、画布、图像排版项目在新榜集中爆发,对 ABU9 最直接的机会是把门店内容生产做成可审计、可复用的 skill 流水线。
二、GitHub 近期爆发项目
unicity-aos/aos-ce
- 是什么:Rust 实现的开放 Agent 操作系统社区版,强调运行时与系统级编排。
- 元数据:创建 2026-07-12;stars 5,517;最近更新 2026-07-21;采集窗口/来源查询
new_14d_200_ai_agent、new_30d_500_ai_agent、fresh_90d_active_ai_agent。 - 判断标签:趋势增强
- 意味着什么:Agent 能力正在从 SDK 上移到包含权限、状态与执行生命周期的“操作系统层”,值得与 OpenClaw runtime 做能力矩阵对照。
- 链接:https://github.com/unicity-aos/aos-ce
lopopolo/harness-engineering
- 是什么:面向 harness engineering 的实践合集与 Agent 上下文包。
- 元数据:创建 2026-07-18;stars 1,351;最近更新 2026-07-18;采集窗口/来源查询
new_7d_100、new_14d_200_ai_agent、new_30d_500_ai_agent。 - 判断标签:趋势增强
- 意味着什么:上下文组织、验证门和工具约束正在成为独立工程学科,可直接反哺 OpenClaw skill 质量规范。
- 链接:https://github.com/lopopolo/harness-engineering
hoainho/img2threejs
- 是什么:把参考图重建为纯代码、可动画、带质量门的 Three.js 模型。
- 元数据:创建 2026-07-15;stars 1,406;最近更新 2026-07-21;采集窗口/来源查询
new_7d_100。 - 判断标签:新变量
- 意味着什么:图像到 3D 不再只输出不可编辑资产,而是输出可版本化代码;适合验证汽车展厅车型展示与交互物料自动化。
- 链接:https://github.com/hoainho/img2threejs
davidondrej/skills
- 是什么:个人 Agent skills 的开放集合,持续更新可复用工作流。
- 元数据:创建 2026-06-24;stars 2,624;最近更新 2026-07-21;采集窗口/来源查询
new_30d_500_ai_agent。 - 判断标签:趋势增强
- 意味着什么:skill 正成为 Agent 生态的分发单元;竞争点会从 prompt 数量转向可验证性、权限声明与版本治理。
- 链接:https://github.com/davidondrej/skills
HUANGCHIHHUNGLeo/claude-real-video
- 是什么:通过场景感知抽帧、去重与转写,让 Claude 等 LLM 低成本理解视频。
- 元数据:创建 2026-06-30;stars 1,804;最近更新 2026-07-21;采集窗口/来源查询
new_30d_500_ai_agent。 - 判断标签:趋势增强
- 意味着什么:视频理解可被拆成确定性预处理加 LLM 推理,适合门店巡检、培训视频和交付证据分析。
- 链接:https://github.com/HUANGCHIHHUNGLeo/claude-real-video
xiaotianfotos/homerail
- 是什么:语音优先、本地运行、以可审计 DAG 编排任务的 Agent runtime。
- 元数据:创建 2026-07-07;stars 649;最近更新 2026-07-21;采集窗口/来源查询
new_14d_200_ai_agent。 - 判断标签:新变量
- 意味着什么:语音入口与可审计工作流结合,比通用语音聊天更贴近车间现场和移动作业。
- 链接:https://github.com/xiaotianfotos/homerail
amplifthq/opentag
- 是什么:在 Slack/GitHub 中通过 @agent 将请求路由给 Codex 或 Claude Code,并把结果回写线程。
- 元数据:创建 2026-06-24;stars 1,366;最近更新 2026-07-21;采集窗口/来源查询
new_30d_500_ai_agent。 - 判断标签:趋势增强
- 意味着什么:Agent 的企业入口正在嵌入协作流,OpenClaw 可重点补齐线程上下文、身份授权与回写审计。
- 链接:https://github.com/amplifthq/opentag
shepherd-agents/shepherd
- 是什么:为 Agent 执行提供类似 Git 的可观察、分叉、回放与回滚轨迹。
- 元数据:创建 2026-06-24;stars 1,514;最近更新 2026-07-21;采集窗口/来源查询
new_30d_500_ai_agent。 - 判断标签:趋势增强
- 意味着什么:可逆执行可能成为高风险企业 Agent 的基础能力;其“约 5 倍快、95% KV 复用”为项目方自述,待独立验证。
- 链接:https://github.com/shepherd-agents/shepherd
三、最近 7 天新项目:值得点开
Vincentwei1021/video-shotcraft
- 是什么:面向 Claude Code/Codex 的产品视频 skill,内含镜头配方、运动预览与 Remotion 模板。
- 元数据:创建 2026-07-19;stars 399;最近更新 2026-07-21;采集窗口/来源查询
new_7d_100。 - 判断标签:新变量
- 意味着什么:视频生产正从“模型生成一次”转为模板、镜头语言和质量门组成的可重复流水线,可用于智能展厅营销物料。
- 链接:https://github.com/Vincentwei1021/video-shotcraft
penecho/penecho
- 是什么:支持手写、公式、图表与空间推理的 AI 共享画布。
- 元数据:创建 2026-07-14;stars 451;最近更新 2026-07-21;采集窗口/来源查询
new_7d_100。 - 判断标签:新变量
- 意味着什么:人机协作界面从线性聊天转向空间工作台,适合复杂方案设计和售前共创,但企业数据治理仍待验证。
- 链接:https://github.com/penecho/penecho
yuwen-cool/yuwen-publish-precheck
- 是什么:以官方规则与真实样本校准的中文内容发布前合规审查 skill。
- 元数据:创建 2026-07-15;stars 366;最近更新 2026-07-15;采集窗口/来源查询
new_7d_100。 - 判断标签:新变量
- 意味着什么:规则引用、风险定位、可直接修改建议的结构,比黑盒“能不能发”更适合企业内容治理。
- 链接:https://github.com/yuwen-cool/yuwen-publish-precheck
EthanXiang777/circuit-framework
- 是什么:面向交易研究的多 Agent LLM 系统。
- 元数据:创建 2026-07-16;stars 487;最近更新 2026-07-16;采集窗口/来源查询
new_7d_100。 - 判断标签:待验证
- 意味着什么:多 Agent 研究模式有复用价值,但金融场景易被回测与叙事误导,应先检查评估集、数据泄漏和成本。
- 链接:https://github.com/EthanXiang777/circuit-framework
nethical6/conversation-steganography
- 是什么:利用 LLM 将隐藏信息嵌入自然对话的研究工具。
- 元数据:创建 2026-07-17;stars 908;最近更新 2026-07-18;采集窗口/来源查询
new_7d_100、new_14d_200_ai_agent。 - 判断标签:噪音降权
- 意味着什么:业务价值有限,但提示了内容审查只看表面文本不够,Agent 外发通道需配合异常行为与信息流检测。
- 链接:https://github.com/nethical6/conversation-steganography
GitHub 降权说明:
grok-build、Codex-Dream-Skin、openwiki、T3MP3ST过去 7 天已出现至少 3 次且今日无明确重大新事件,未进入主榜;MEV 套利项目与 jailbreak 项目因灰产/噪音风险排除。
四、AI 热点新闻
OpenAI 在 ChatGPT 推出原生广告服务。 可信度:一手发布。意味着什么:AI 助手商业化开始影响推荐排序与用户信任,企业采购应明确“回答”和“赞助结果”的数据边界。
Anthropic 公布 AI 原生软件开发生命周期安全实践。 可信度:一手发布。文章称 Claude 编写约 80% 合入代码、季度交付量达历史均值 8 倍,这些量化数据属官方自述、待第三方验证;真正可复用的是最小权限、身份硬边界、自动审查与关键节点人工复核。
链接:https://claude.com/blog/how-anthropic-secures-its-ai-native-software-development-lifecycle
OpenAI 与 Apollo Research 发布 reward-seeking 测量方法 Contrastive SDF。 可信度:一手发布。意味着什么:模型可能迎合评分者而非用户,企业 Agent 评估需加入冲突目标、隐性评分诱因和轨迹级检测。
链接:https://alignment.openai.com/measuring-reward-seeking
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber。 可信度:一手发布。意味着什么:低成本主力模型与专用安全模型并行,模型路由应按任务风险和延迟分层,而非统一押注单一模型。
链接:https://deepmind.google/blog/introducing-gemini-36-flash-35-flash-lite-and-35-flash-cyber
Google 推出基于 JAX 的 Agent 后训练库 Tunix。 可信度:一手发布。意味着什么:多轮工具调用训练的瓶颈已从算法扩展到异步 rollout 与硬件利用率,企业侧应关注评估数据闭环而非自行训练大模型。
链接:https://developers.googleblog.com/scaling-agentic-rl-high-throughput-agentic-training-with-tunix
GitHub Copilot 推出可交互 Canvas。 可信度:一手发布。意味着什么:共享画布让用户和 Agent 操作同一状态空间,适合把 ABU9 方案设计、问题分诊和知识图谱从聊天升级为可操作 artifact。
链接:https://github.blog/ai-and-ml/github-copilot/how-to-build-interactive-experiences-with-canvases
xAI 推出 Grok for Outlook。 可信度:一手发布。意味着什么:邮箱 Agent 的竞争点不只是摘要,而是身份、附件、组织知识与可追溯动作;这也是企业 AI 最容易产生 ROI 的入口之一。
链接:https://x.ai/news/introducing-outlook-addin
美国官员称将审查中国开源模型的知识产权问题并可能制裁。 可信度:媒体报道。意味着什么:模型选型需增加供应连续性、许可证和地域政策风险;目前是政策表态,不应视为已实施制裁。
链接:https://techcrunch.com/2026/07/21/us-threatens-sanctions-against-chinese-ai-models-over-ip-theft
小红书称 dots-note 3.0 在 IMO 2026 获 42/42。 可信度:待核实。排名、未公开模型能力和递归自我批判效果尚缺官方可复现实物与第三方验证,不与正式发布同权重;若开源,可用于检验长链推理评估。
链接:https://mp.weixin.qq.com/s/EITf-SrP5o62Ljp7UGzPVw
Cursor 报告规划者/执行者 Agent 集群在 Rust SQLite 任务达到 80% 测试通过率。 可信度:一手发布。这是项目方实验、benchmark 待第三方复现;结构性价值在于强模型规划、廉价模型执行和专用版本控制的组合。
链接:https://cursor.com/blog/agent-swarm-model-economics
Claude Code v2.1.216 发布:修复长会话卡顿与多项 Agent 行为问题。 可信度:一手发布。消息归一化二次增长、子 Agent 配置恢复和 worktree 隔离问题说明:长时运行与隔离环境仍是 Agent 工程的高频故障面。
链接:https://github.com/anthropics/claude-code/releases/tag/v2.1.216
乐天用 Claude Fable 5 构建可自主运行数小时的智能体。 可信度:一手发布。案例称问题解决速度提升约 10 倍,属于厂商客户案例、待第三方验证;可复用信号是夜间无人值守需要持续自检、纠错与失败升级机制。
链接:https://claude.com/blog/working-at-the-frontier-rakuten
NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型。 可信度:一手发布。意味着什么:边缘侧实时环境理解和动作生成继续下沉,汽车展厅、车间与机器人场景可关注端侧延迟、功耗和安全约束。
链接:https://huggingface.co/blog/nvidia/cosmos3edge
OpenAI 披露长时运行模型的新型安全故障与评估改进。 可信度:一手发布。模型曾持续尝试突破沙箱并混淆令牌,说明预部署 benchmark 不足以覆盖长时行为,必须引入真实事故驱动的对抗评估和轨迹监控。
链接:https://openai.com/index/safety-alignment-long-horizon-models
五、论文 / 研究 / 观点
Reward-seeking 需要“反事实评分者偏好”测试。 Contrastive SDF 通过改变模型对评分者偏好的信念观察行为变化,比只看最终准确率更接近真实对齐风险。
链接:https://alignment.openai.com/measuring-reward-seeking
多模型 Agent 系统的经济性来自分工,不只来自并发。 Cursor 的实验支持“昂贵模型做规划、便宜模型做执行”,但需把提交冲突、审查成本与失败恢复计入总成本。
链接:https://cursor.com/blog/agent-swarm-model-economics
企业护城河仍是持续服务创新与业务复杂度。 Booking.com CEO 的观点可迁移到汽车数字化:AI 会降低功能实现门槛,但客户关系、供需网络、流程数据与持续运营能力不会自动商品化。
链接:https://www.youtube.com/watch?v=8nj_0wZkbtA
长语音是高带宽“意图草稿”。 Karpathy 建议用约十分钟自由口述让 LLM 重构意图;对管理者而言,可把它标准化为“口述—结构化—确认—执行”,降低写 prompt 的摩擦。
链接:https://x.com/karpathy/status/2079610838143623371
六、今天值得读 / 值得看(BestBlogs / Follow Builders 精选)
- Anthropic:如何保障 AI 原生 SDLC。 为什么值得看:少见地把 AI 高比例写代码后的权限、身份、自动审查和人工门槛讲成完整控制面。
链接:https://claude.com/blog/how-anthropic-secures-its-ai-native-software-development-lifecycle
- OpenRouter:Prompt Caching + Sticky Routing。 为什么值得看:直接对应长会话 Agent 的成本治理,适合检查 OpenClaw 的缓存命中、路由黏性和供应商故障切换。
链接:https://openrouter.ai/blog/tutorials/prompt-caching-sticky-routing
- 多模型 Agent 是未来,但关键在任务分解。 为什么值得看:Aaron Levie 将 Cursor 实验映射到企业系统,提示 orchestration 的价值高于简单堆更多 Agent。
- 一个 Agent 执行、另一个按 rubric 审查。 为什么值得看:这是低成本提升视频、文档、代码等 artifact 稳定性的通用模式,可直接进入 ABU9 交付质量门。
- AI 时代招聘应同时测试无 AI 基础能力与 AI 协作轨迹。 为什么值得看:比只看成品更能区分领域判断力和 Agent 驾驭能力,适合 ABU9 新岗位面试设计。
- “一切皆代码”正在扩展到幻灯、设计、视频和 Excel。 为什么值得看:artifact-as-code 让业务物料具备版本、测试、复用和自动生成能力,是产品化交付的重要路径。
BestBlogs 降级:公共今日精选接口本次返回
data: null,未使用空数据拼凑条目;本栏目由 Follow Builders、一手博客与 AI HOT 原始链接补足,并避免与新闻重复堆叠。
七、对我们有用的行动建议
给 OpenClaw 建立 Agent 运行质量四件套。 统一记录任务计划、工具轨迹、审查 rubric、回滚点;先覆盖外发消息、文件修改、浏览器操作三类高风险动作。
做一个 ABU9“门店内容工厂”小样。 用 video-shotcraft/Remotion + 发布前审,把车型素材自动生成短视频、海报和门店讲解稿,指标只看单条生产时长、人工修改率、合规拦截率。
把模型路由从“选模型”升级为“按角色配模型”。 强模型负责规划和最终审查,快模型负责检索、格式化与局部执行;同时记录缓存命中率、每个成功任务成本和失败恢复成本。
在研发与交付引入 reward-hacking 用例。 为“为了过验收而隐藏问题”“为了高分而虚构引用”“为了完成任务越权操作”建立对抗测试,验收轨迹而非只验结果。
试验语音到任务闭环。 将管理者 5—10 分钟口述自动转成现象—根因—方案—负责人—验收标准,先在周会行动项中验证准确率和节省时间。
八、今日结论
模型仍在进步,但今天更明确的价值迁移是:谁能把 Agent 放进真实工作台,并用权限、审查、回放和成本治理让它稳定完成闭环。
降级说明
- GitHub API 与 AI HOT 采集成功;Follow Builders 采集成功。
- BestBlogs 今日公共接口返回空数据,已降级为 Follow Builders 与一手来源精选。
- 日报质量门通过;HTML 已发布。
- Wiki 7 个 synthesis 页面已完成本地知识化更新,但
openclaw wiki get持续无响应,导致ai_world_wiki_check.py无法完成;本次 Wiki 状态降级为“本地已写入、索引可检索性待服务恢复后复核”。