🤖 AI 日报 · 2026-08-21(周五)
聚焦 AI Coding 与 具身智能 · 数据时效截至 09:50(北京时间)· 自动化任务「每日 AI 新闻推送」第六次生成(社区信源强化版)
AI Coding具身智能
DeepSeek 今日有 D ✅
15 条精选3 条待验证快讯
📡 社区信源监控(按速度排序 · 多方验证先行)
原则:媒体报道有延迟,重大动态先在社区发酵。下方按「官方公告 / Release / ≥2 独立社区源」分级,未交叉验证的重要线索单列「社区快讯(待验证)」。
| 平台 | 账号 / 帖子 | 时间 | 线索 | 验证状态 |
| Hacker News | DeepSeek Harness 主贴 | 8/13 当周 | 首日 GitHub Star 破 3 万、登顶 HN、最快破 2 万 Star;高赞"这次它看起来相当原创" | 已确认 HN+36氪+官方 repo |
| X(Twitter) | @Teortaxes | 8/9 02:48 | Flash-0731 长程 Agent 测试,/goal 后睡觉早上见进展 | 社区一手 |
| X(Twitter) | @yacineMTB | 8 月上旬 | 手机上用 Flash-0731 反编译 5000 行 Melee C | 社区一手 |
| X(Twitter) | @Wes Roth | 8/6 | 截图:DeepSeek 定价通知由"峰谷"改为"显著上涨" | 部分印证 8/17 官方生效 |
| Reddit r/LocalLLaMA | "it's up now" | 8/13 | V4 Pro 正式版 API 开放刷屏 | 已确认 |
| GitHub Trending | deepseek-ai/deepseek-harness | 本周 | MIT 开源 Agent 编排底座 | 已确认 |
📌 导读
两条主线:① Agent 从"模型能力"竞赛转向"执行层 / 调度层"竞赛——OpenAI 开源 Codex Harness、DeepSeek Harness RC.8 收编 Claude Code/Codex、Slack/Grok Bot 嵌进工作流;
② 具身智能从"炫技"转向"上岗"——世界机器人大会 311 款新品,宇树 7 轴机械臂打到 9900 元,行业进入"量产交付"大考。DeepSeek 今日有料(见专项)。
一、今日 15 条精选
🧩 AI Coding / 智能体编程(8 条)
1. OpenAI 全面开源 Codex Harness —— 把"顶级 Agent 发动机"免费送出
⏱ 时效:2026-08-19 宣布 / 08-21 媒体发酵
OpenAI 将驱动 Codex 智能体的底层核心框架 Harness 作为平台全面开源(含 CLI/SDK/App Server,支持非交互执行与 CI/CD)。总裁 Greg Brockman 在 X 转发:"Codex 能驱动的远不止编程工具"。开发者可直接把 Agent 循环嵌进自有产品、工程工具、运营看板。
💡 比模型更底层的"Agent 运行编排底座"开源,竞争从"谁模型强"转向"谁定义任务入口与调度标准"。
来源:新智元(2026-08-21 07:57) / 微博 @老张聊科技 / Greg Brockman X
2. DeepSeek Harness RC.8:多模态 + 把 Claude Code / Codex 收编为子代理
⏱ 时效:2026-08-19 深夜(RC.8)/ 08-21 报道
DeepSeek Harness 发布 RC.8(一周三更)。多模态补齐:原生图片请求 + 图文混合输入;Claude Code 与 Codex 作为 Profile Bundle 按需安装并作为子代理调用;web_search 并发、Windows 持久化 PowerShell 会话。
💡 从"开源框架"演进为统一调度层,跨模型编排竞品 Agent。HN 高赞:"这次它看起来相当原创"。
来源:36氪(2026-08-21) / 腾讯研究院 AI 速递 / Hacker News(已确认·多方印证)
3. Anthropic 最快本月底公开递交 IPO,募资或超 SpaceX 862 亿美元纪录
⏱ 时效:2026-08-21
多家媒体援引知情人士:Anthropic 筹备最快本月底公开提交 IPO 文件,意在打破 SpaceX 862 亿美元(含超额配售)纪录;二季度营收突破 115 亿美元(同比 +14 倍+),反超 OpenAI。
💡 "大模型真能赚钱"在资本市场的强验证,估值逻辑从"烧钱预期"转向"营收兑现"。
来源:财联社 / 彭博 / 全天候科技(2026-08-21)
4. Claude Code ARR 151.2 亿美元领跑,但增速放缓、Codex 在追
⏱ 时效:2026-08-20
截至 8/10 Claude Code ARR 151.2 亿美元领先 Codex 88.3 亿;但环比仅 +5.2%,同期 Codex 增幅超 50%,差距由 83.8 亿缩至约 63 亿。
💡 AI Coding 已是真实营收赛道,但"水印+额度限制"引发退订,体验与定价决定留存。
来源:InfoQ / TickerTrends(2026-08-20)
5. Grok Bot 走红硅谷,被称"又一个 Claude Code 时刻"
⏱ 时效:2026-08-21
xAI 的 Grok Bot 引发热议,个人 AI 使用量增约 100 倍,15 秒搭出播客摘要器。"零配置 + 强制云端 VM + 多智能体原生协同",Bot 间自动传递上下文、接力任务。订阅约 200 美元/月。
💡 竞争焦点从"模型能力"转向"产品封装 + 工作流协同"。
来源:腾讯研究院 AI 速递 / 36氪 / 雪球(8/21)
6. 字节 Seed-OSS-36B 开源:原生 512K 上下文 + 可控"思考预算"
⏱ 时效:2026-08-20
字节 Seed 开源 Seed-OSS-36B(Apache 2.0,36B 稠密、12T tokens),原生 512K 上下文,以 512 token 粒度调节"思考预算"。
💡 开源从"追参数"转向"追工程实用性",企业级长文档/大代码库极具吸引力。
来源:字节 Seed 官方博客 / Hugging Face(2026-08-20)
7. 阿里发布 Qwen-UI-Agent:让模型"看懂屏幕"直接操作 App
⏱ 时效:2026-08-20
阿里千问推出 GUI 智能体基座 Qwen-UI-Agent,覆盖手机/PC/网页/深度搜索,可模拟点击、输入、滑动操作未开放 API 的传统软件。MobileWorld 82.1%、真机 92.2%、WebArena 73.6%。
💡 "屏幕当成最大接口"——智能体从工具调用者变为数字设备通用执行器。
来源:阿里千问官方公众号 / 快科技 / IT之家(2026-08-20)
8. Slack Code 上线:把 AI 编程从"单人终端"搬进"团队频道"
⏱ 时效:2026-08-20
Salesforce 在 Slack 推出 Slack Code,频道内 @ Claude Code / Devin / Copilot / Vercel Agent 即建"代码频道",展示计划、diff、PR、HTML 预览,自动归档审计日志。全套餐免费。
💡 把 Agent 工作流嵌入团队协作中枢,交互范式升级。
来源:The Verge / VentureBeat / TNW(2026-08-20);Marc Benioff X
🤖 具身智能 / 机器人(7 条)
9. 2026 世界机器人大会开幕:373 家企业、3000 件产品、311 款新品
⏱ 时效:2026-08-19 ~ 08-20
以"人机共生、产需共融"为主题在北京亦庄开幕,373 家企业、3000 件产品参展,311 款新品亮相,发布"智能机器人向上向善发展倡议"。工信部副部长辛国斌:以智能化为主线推动创新发展。
💡 具身智能从"能跑会跳"向"能想会干"进化,观察技术风向与产业落地核心窗口。
来源:新华网(2026-08-20)
10. 超维动力 KAI:全球首个人形机器人自主乒乓完整对局(SMASH 2.0,117 自由度)
⏱ 时效:2026-08-19
超维动力携 SMASH 2.0 实现全球首个自主完整对局;KAIBot 本体达全球最高 117 个全身自由度,配套 KAI 世界模型(百万级视频预训练),"一脑多形"跨本体对打。
💡 高速动态场景"感知—决策—控制"全链路自主里程碑。
来源:新华网(2026-08-19/20);央广网世界模型专题(8/20)
11. 宇树发布 7 轴仿生机械臂 R1,起售价 9900 元——万元级价格拐点
⏱ 时效:2026-08-20
"人形机器人第一股"宇树(8/19 登陆科创板 688836)发布首款万元以下机械臂 R1,7 轴、自重 5.5kg、臂展 650mm、负载 2kg、精度约 0.1mm,将开源控制程序与接口协议。
💡 把协作机械臂门槛砍掉一个数量级,复刻"低价硬件+开源生态"打法。
来源:新浪财经 / PChome / 电子发烧友(2026-08-20);China News(8/20)
12. 北京人形机器人创新中心发布 Pelican Unify 1.0 + 天工 Omni
⏱ 时效:2026-08-19 ~ 08-20
发布具身多模态大模型 Pelican-Unify 1.0(感知—理解—决策—执行),首发超智能新物种 天工 Omni(轻量化小人形开放平台,演示梅花桩、上下楼梯、匍匐爬行,开放底层接口)。
💡 从"功能拼凑"迈入"协同进化",开放平台降低二次开发与真机部署门槛。
来源:新华网 / 光明日报(2026-08-19/20)
13. 全国首个具身机器人演出"沙盒审批"落地北京经开区
⏱ 时效:2026-08-20
为 3 家企业颁发具身机器人演出沙盒审批准入,上线全国首个全流程管理系统(入盒—审查—试验—监督—出盒),首批接入 7 台机器人、14 名安全员、16 套监控探头。
💡 补"制度基础设施"——监管路径清晰度成为落地速度关键变量。
来源:央广网 / 新京报(2026-08-20)
14. 环球时报探访:中国人形机器人"务实转身",上半年出货超 4 万台、全球占 97%
⏱ 时效:2026-08-21
跳舞机器人少了、干活多了。开普勒"大黄蜂"搬运 30kg 上岗工厂并出口美德奥;星海图超市拣货、擎朗洗衣叠衣完成完整流程。大会报告:2026 上半年中国人形机器人出货超 4 万台,全球占比 97%。
💡 产业进入下半场,三问变"能不能干活、能不能规模化、客户愿不愿持续付费"。
来源:环球时报(2026-08-21)
15. 行业"量产交付"大考:优必选 U1 超 1.3 万订单 9 月交付
⏱ 时效:2026-08-15 ~ 08-20
智身科技累计量产破 1.5 万台(6 月单月 5000+);优必选 U1 全渠道订单破 13361 台、9 月交付;星动纪元二季度千台级交付、增速 300%。上半年全球出货约 1.91 万台,中国占 97%+。
💡 从"Demo"转向"量产";但"签约≠交付≠稳定运营≠复购",良率/一致性才是真考验。
来源:中国经营报 / 世界机器人大会(2026-08-15/20)
二、社区快讯(待验证 · 单列)
①(待验证/低置信度)DeepSeek V3.1 发布(8/20 晚,聚合号):据称整合 V3 快答与 R1 推理、上下文扩至 128K、加 strict Function Calling。非官方聚合号,缺官方公告印证,建议以 DeepSeek 官方为准。
②(社区观察)Reddit r/LocalLLaMA 个别用户反馈 Flash-0731 "overfit to coding":偶发陷入推理循环,属一手体验非缺陷定论,缺大规模独立复现。
③(社区线索已部分印证)X/@Wes Roth 8/6 截图:定价通知由"峰谷"改为"显著上涨",与 8/17 官方峰谷定价方向一致,具体涨幅以官方公告为准。
三、DeepSeek 专项(今日有 D ✅)
今日有 D 今日检索到多条 DeepSeek 信息,故
非"今日无D":
| # | 事件 | 时效 / 来源 |
| 1 | DeepSeek Harness RC.8 更新:多模态 + 收编 Claude Code/Codex 子代理(见精选 #2;HN 登顶、最快破 2 万 Star) | 8/21 · 36氪/腾讯研究院 |
| 2 | 服务崩溃约 12 小时已恢复:昨夜今晨大量用户"服务器繁忙/无法新对话",截至发稿已恢复(已确认当日真实事件) | 8/21 · 中新经纬 |
| 3 | "价格屠夫收刀"叙事:反向上调 V4 旗舰价(高峰输出约 27 元/百万 tok,约原价 4.7 倍),业界现"DeepSeek 死亡之谷"说法 | 8/21 · 钛媒体/36氪 |
| 4 | (次级·待核验)DeepSeek V3.1 发布 | 8/20 晚 · 聚合号 |
四、AI 多项能力评分(多源交叉)
llm-stats「综合分」与 LiveBench「Overall」算法/量纲不同,数值不可直接相减,并列呈现供交叉参考。LiveBench = 2026-06-25 release(污染无关 23 任务)。
4.1 llm-stats 综合智能(2026-08-21 实时 · 全榜 358 模型)
| 排名 | 模型 | 综合分 | 推理 | 编码 | Agent | 上下文 | 许可 |
| 1 | GPT-5.6 Sol | 57.4 | 56.9 | 50.6 | 44.4 | 1.1M | 闭源 |
| 2 | Claude Opus 5 | 56.3 | 55.4 | 42.7 | 41.5 | 1.0M | 闭源 |
| 3 | Claude Fable 5 | 56.1 | 53.7 | 48.8 | 42.8 | 1.0M | 闭源 |
| 4 | Kimi K3 | 54.9 | 53.9 | 45.9 | 41.6 | 1.0M | 开源 |
| 5 | GLM-5.3(NEW) | 54.7 | 54.9 | 45.4 | 41.8 | 753B | 闭源 |
| 6 | DeepSeek-V4-Pro-0813 | 54.2 | 52.2 | 43.3 | 40.3 | 1.0M | 开源 |
| 7 | Qwen3.8 Max | 53.3 | 52.0 | 42.3 | 40.0 | 2.4T | 开源 |
| 8 | GPT-5.6 Terra | 52.9 | 51.2 | 46.3 | 40.8 | 1.1M | 闭源 |
| 9 | Claude Opus 4.8 | 51.9 | 51.4 | 43.9 | 37.0 | 1.0M | 闭源 |
| 10 | Muse Spark 1.1 | 51.8 | 52.4 | 37.9 | 38.0 | 1.0M | 闭源 |
| 11 | Gemini 3.7 Flash | 51.2 | 50.1 | 38.6 | 36.0 | 1.0M | 闭源 |
| 12 | Claude Sonnet 5 | 49.6 | 49.1 | 40.1 | 34.0 | 1.0M | 闭源 |
| 13 | GPT-5.5 | 49.3 | 48.6 | 41.2 | 34.7 | 1.1M | 闭源 |
| 14 | Grok 4.5 | 47.5 | 45.8 | 39.4 | 34.1 | 500K | 闭源 |
| 15 | DeepSeek-V4-Flash-0731 | 47.4 | — | — | — | 1.0M | 开源 |
4.2 LiveBench 综合智能(2026-06-25 release · Max/High Effort)
| 模型 | Overall | 推理 | 编码 | Agentic | 数学 | 数据 | 语言 | 指令 | $/任务 |
| Claude Fable 5 | 83.0 | 89.7 | 86.0 | 62.2 | 96.0 | 80.5 | 90.7 | 75.8 | 1.439 |
| GPT-5.6 Sol | 81.0 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | 0.515 |
| GPT-5.5 Thinking | 80.2 | 89.7 | 82.1 | 54.0 | 95.9 | 81.6 | 87.4 | 70.7 | 0.435 |
| Claude 5 Opus | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | 0.699 |
| Kimi K3(开源) | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | 0.348 |
| Gemini 3.7 Flash | 78.8 | 87.8 | 78.9 | 58.3 | 93.5 | 68.0 | 85.5 | 79.9 | 0.157 |
| Qwen 3.8 Max(开源) | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | 0.275 |
| Grok 4.6 | 78.0 | 90.5 | 76.8 | 57.0 | 92.6 | 73.9 | 83.7 | 71.9 | 0.207 |
| GPT-5.6 Terra | 77.9 | 90.6 | 78.2 | 54.9 | 94.9 | 79.3 | 82.9 | 64.6 | 0.352 |
| DeepSeek-V4-Pro-0813(开源) | 77.4 | 85.7 | 77.2 | 54.9 | 95.1 | 79.2 | 82.1 | 67.7 | 0.044 |
| Claude Opus 4.8 | 76.2 | 89.2 | 81.8 | 50.5 | 94.3 | 66.0 | 79.7 | 72.0 | 0.983 |
| Claude Sonnet 5 | 76.0 | 88.7 | 80.7 | 59.4 | 92.9 | 71.7 | 75.0 | 63.9 | 0.505 |
| GLM-5.2(开源) | 73.2 | 78.6 | 79.7 | 51.8 | 89.8 | 73.7 | 76.2 | 62.3 | 0.225 |
| DeepSeek-V4-Flash-0731(开源) | 74.2 | 86.6 | 75.0 | 46.8 | 86.8 | 79.3 | 79.2 | 65.5 | 0.060 |
开源头部:DeepSeek-V4-Pro-0813(LB 77.4)、Kimi K3(79.2)、Qwen 3.8 Max(78.5)已逼近闭源第一梯队;DeepSeek V4 Pro「每成功任务成本」0.044 美元居全球最低档之一。
五、价格表
5.1 主流模型 API 价格($/M 综合价 · llm-stats 2026-08-21)
| 模型 | 输入 $/M | 输出 $/M | 上下文 | 许可 |
| GPT-5.6 Sol | 5.00 | 30.00 | 1.1M | 闭源 |
| Claude Opus 5 | 5.00 | 25.00 | 1M | 闭源 |
| Claude Fable 5 | 10.00 | 50.00 | 1M | 闭源 |
| GPT-5.5 | 5.00 | 30.00 | 1.1M | 闭源 |
| Claude Opus 4.8 | 5.00 | 25.00 | 1M | 闭源 |
| Claude Sonnet 5 | 2.00 | 10.00 | 1M | 闭源 |
| GPT-5.6 Terra | 5.00* | 30.00* | 1.1M | 闭源 |
| Grok 4.5 | 2.00 | 6.00 | 500K | 闭源 |
| Kimi K3(开源) | 3.00 | 15.00 | 1M | 开源 |
| Gemini 3.5 Flash | 1.50 | 9.00 | 1M | 闭源 |
| Gemini 3.6 Flash | 1.50 | 7.50 | 1M | 闭源 |
| GPT-5.2 | 1.75 | 14.00 | 400K | 闭源 |
| GPT-5.3 Codex | 1.75 | 14.00 | 400K | 闭源 |
| DeepSeek-V4-Pro-0813(开源) | 见 5.2 | 见 5.2 | 1M | 开源 |
| DeepSeek-V4-Flash-0731(开源) | 0.09 | 0.18 | 1M | 开源 |
| GLM-5.2(开源) | 0.95 | 3.00 | 1M | 开源 |
| Kimi K2.6(开源) | 0.75 | 3.50 | 262K | 开源 |
5.2 DeepSeek V4 官方峰谷定价(CNY · 2026-08-17 00:00 生效)
| 型号 | 时段 | 缓存命中输入 | 缓存未命中输入 | 输出(元/百万 tok) |
| V4-Pro | 高峰 9–12 / 14–18 | 0.30 | 9.0 | 27.0 |
| V4-Pro | 空闲(其余) | 0.15 | 4.5 | 13.5 |
| V4-Flash | 高峰 | — | — | 9.0 |
| V4-Flash | 空闲 | — | — | 4.5 |
高峰价为空闲价 2 倍;V4-Pro 输出由 6→27 元(+350%)。约 27 元 ≈ $3.8/M,仍显著低于 Claude 5($25–50/M)、GPT-5.6 Sol($30/M)。来源:中国金融新闻网/腾讯新闻(8/17) + @Wes Roth X 截图(8/6) 提前预告。
5.3 LiveBench 每成功任务成本(USD · 2026-06-25 release 节选)
| 模型 | $/成功任务 |
| Grok Build 0.1 | 0.024 |
| DeepSeek V4 Flash 0731(开源) | 0.060 |
| DeepSeek V4 Pro 0813(开源) | 0.044 |
| GPT-5.4 Nano (xHigh) | 0.091 |
| Gemini 3.7 Flash (High) | 0.157 |
| Kimi K2.6 Thinking(开源) | 0.169 |
| GPT-5.6 Luna (Max) | 0.169 |
| Qwen 3.8 Max(开源) | 0.275 |
| GPT-5.5 Thinking (xHigh) | 0.435 |
| Claude Opus 5 (Thinking Max) | 0.699 |
| Claude Fable 5 (Max) | 1.439 |
六、Price vs Performance(性价比 · 分/美元 · llm-stats 当日)
计算口径:性价比 = llm-stats 综合分 ÷ Pricing $/M(综合价)。
DeepSeek V4 Pro 以 112.9 分/美元断崖第一;若按输出价口径 V4-Flash 约 260+ 分/美元(全球最低成本档)。闭源旗舰普遍 4–20 分/美元,"DeepSeek 死亡之谷"由此而来。
条形长度按最大值 112.9 归一化。数据来源:llm-stats.com(2026-08-21)。
七、GitHub 热门 AI 项目(weekly · 2026-08-21)
| # | 仓库 | 本周新增 ⭐ | 语言 | 方向 |
| 1 | cathrynlavery/diagram-design | +11.3k | HTML | 为 Claude Code/Codex/Pi 提供 38 种编辑型图表 |
| 2 | public-apis/public-apis | +11.3k | Python | 免费 API 汇总(AI 项目常用) |
| 3 | harry0703/MoneyPrinterTurbo | +9.7k | Python | AI 一键生成短视频 |
| 4 | volcengine/OpenViking | +2.4k | Python | 面向 Agent 的自进化上下文数据库(记忆/RAG) |
| 5 | semantica-agi/semantica | +3.7k | Python | 图形原生基础设施,可问责 AI |
| 6 | cactus-compute/needle | +3.4k | Python | 14MB 基础模型跑机器人等微型设备(具身/边缘) |
| 7 | unslothai/unsloth | +3.3k | Python | 本地运行/训练 LLM(Qwen/Gemma/DeepSeek) |
| 8 | akitaonrails/ai-memory | +2.0k | Rust | 编程 Agent CLI 长期记忆、跨厂商交接 |
| 9 | CodebuffAI/freebuff | +1.1k | TS | 免费 AI 编程智能体 |
| 10 | NVIDIA-NeMo/Switchyard | +0.9k | Rust | LLM 跨模型/供应商路由 |
信号:AI Coding 仍是开源最热赛道(diagram-design/freebuff/ai-memory 集中上榜);具身/边缘方向出现 needle(14MB 模型跑机器人);deepseek-harness 本周在 Agent 编排类持续霸榜。来源:github.com/trending?since=weekly(2026-08-21)。
八、数据来源与时效说明
llm-stats.comLiveBench 2026-06-25Artificial Analysis v4.1.1
新智元网易财联社彭博
36氪InfoQ新华网央广网
环球时报科技日报腾讯研究院中新经纬
Hacker NewsX(Twitter)Reddit r/LocalLLaMAGitHub Trending
- 能力评分:llm-stats(2026-08-21 实时,全榜 358);LiveBench 2026-06-25 release;Artificial Analysis 为 JS 动态页,仅取方法论(Intelligence Index v4.1.1,9 项评估),未编造行级数据。
- 价格:llm-stats $/M 实时综合价;DeepSeek V4 峰谷定价(2026-08-17 生效);LiveBench 每成功任务成本(2026-06-25)。
- 社区信源:HN / X @Teortaxes @yacineMTB @Wes Roth / Reddit r/LocalLLaMA / GitHub Trending。社区单源线索已单列「社区快讯(待验证)」。
- 新闻时效:均标注具体日期;8/21 当日事件经多源交叉,个别次级来源(V3.1)已标注"待核验"。
- 免责:评分为第三方基准,受测试设置/提示词/采样影响;价格随厂商调整频繁变动,请以各官方定价页为准。本日报仅作信息整理,不构成投资建议。