🤖 AI 日报 · 2026-08-21(周五)

聚焦 AI Coding具身智能 · 数据时效截至 09:50(北京时间)· 自动化任务「每日 AI 新闻推送」第六次生成(社区信源强化版)
AI Coding具身智能 DeepSeek 今日有 D ✅ 15 条精选3 条待验证快讯

📡 社区信源监控(按速度排序 · 多方验证先行)

原则:媒体报道有延迟,重大动态先在社区发酵。下方按「官方公告 / Release / ≥2 独立社区源」分级,未交叉验证的重要线索单列「社区快讯(待验证)」。
平台账号 / 帖子时间线索验证状态
Hacker NewsDeepSeek Harness 主贴8/13 当周首日 GitHub Star 破 3 万、登顶 HN、最快破 2 万 Star;高赞"这次它看起来相当原创"已确认 HN+36氪+官方 repo
X(Twitter)@Teortaxes8/9 02:48Flash-0731 长程 Agent 测试,/goal 后睡觉早上见进展社区一手
X(Twitter)@yacineMTB8 月上旬手机上用 Flash-0731 反编译 5000 行 Melee C社区一手
X(Twitter)@Wes Roth8/6截图:DeepSeek 定价通知由"峰谷"改为"显著上涨"部分印证 8/17 官方生效
Reddit r/LocalLLaMA"it's up now"8/13V4 Pro 正式版 API 开放刷屏已确认
GitHub Trendingdeepseek-ai/deepseek-harness本周MIT 开源 Agent 编排底座已确认

📌 导读

两条主线:① Agent 从"模型能力"竞赛转向"执行层 / 调度层"竞赛——OpenAI 开源 Codex Harness、DeepSeek Harness RC.8 收编 Claude Code/Codex、Slack/Grok Bot 嵌进工作流; ② 具身智能从"炫技"转向"上岗"——世界机器人大会 311 款新品,宇树 7 轴机械臂打到 9900 元,行业进入"量产交付"大考。DeepSeek 今日有料(见专项)。

一、今日 15 条精选

🧩 AI Coding / 智能体编程(8 条)

1. OpenAI 全面开源 Codex Harness —— 把"顶级 Agent 发动机"免费送出

⏱ 时效:2026-08-19 宣布 / 08-21 媒体发酵
OpenAI 将驱动 Codex 智能体的底层核心框架 Harness 作为平台全面开源(含 CLI/SDK/App Server,支持非交互执行与 CI/CD)。总裁 Greg Brockman 在 X 转发:"Codex 能驱动的远不止编程工具"。开发者可直接把 Agent 循环嵌进自有产品、工程工具、运营看板。
💡 比模型更底层的"Agent 运行编排底座"开源,竞争从"谁模型强"转向"谁定义任务入口与调度标准"。
来源:新智元(2026-08-21 07:57) / 微博 @老张聊科技 / Greg Brockman X

2. DeepSeek Harness RC.8:多模态 + 把 Claude Code / Codex 收编为子代理

⏱ 时效:2026-08-19 深夜(RC.8)/ 08-21 报道
DeepSeek Harness 发布 RC.8(一周三更)。多模态补齐:原生图片请求 + 图文混合输入;Claude Code 与 Codex 作为 Profile Bundle 按需安装并作为子代理调用;web_search 并发、Windows 持久化 PowerShell 会话。
💡 从"开源框架"演进为统一调度层,跨模型编排竞品 Agent。HN 高赞:"这次它看起来相当原创"。
来源:36氪(2026-08-21) / 腾讯研究院 AI 速递 / Hacker News(已确认·多方印证)

3. Anthropic 最快本月底公开递交 IPO,募资或超 SpaceX 862 亿美元纪录

⏱ 时效:2026-08-21
多家媒体援引知情人士:Anthropic 筹备最快本月底公开提交 IPO 文件,意在打破 SpaceX 862 亿美元(含超额配售)纪录;二季度营收突破 115 亿美元(同比 +14 倍+),反超 OpenAI。
💡 "大模型真能赚钱"在资本市场的强验证,估值逻辑从"烧钱预期"转向"营收兑现"。
来源:财联社 / 彭博 / 全天候科技(2026-08-21)

4. Claude Code ARR 151.2 亿美元领跑,但增速放缓、Codex 在追

⏱ 时效:2026-08-20
截至 8/10 Claude Code ARR 151.2 亿美元领先 Codex 88.3 亿;但环比仅 +5.2%,同期 Codex 增幅超 50%,差距由 83.8 亿缩至约 63 亿。
💡 AI Coding 已是真实营收赛道,但"水印+额度限制"引发退订,体验与定价决定留存。
来源:InfoQ / TickerTrends(2026-08-20)

5. Grok Bot 走红硅谷,被称"又一个 Claude Code 时刻"

⏱ 时效:2026-08-21
xAI 的 Grok Bot 引发热议,个人 AI 使用量增约 100 倍,15 秒搭出播客摘要器。"零配置 + 强制云端 VM + 多智能体原生协同",Bot 间自动传递上下文、接力任务。订阅约 200 美元/月。
💡 竞争焦点从"模型能力"转向"产品封装 + 工作流协同"。
来源:腾讯研究院 AI 速递 / 36氪 / 雪球(8/21)

6. 字节 Seed-OSS-36B 开源:原生 512K 上下文 + 可控"思考预算"

⏱ 时效:2026-08-20
字节 Seed 开源 Seed-OSS-36B(Apache 2.0,36B 稠密、12T tokens),原生 512K 上下文,以 512 token 粒度调节"思考预算"。
💡 开源从"追参数"转向"追工程实用性",企业级长文档/大代码库极具吸引力。
来源:字节 Seed 官方博客 / Hugging Face(2026-08-20)

7. 阿里发布 Qwen-UI-Agent:让模型"看懂屏幕"直接操作 App

⏱ 时效:2026-08-20
阿里千问推出 GUI 智能体基座 Qwen-UI-Agent,覆盖手机/PC/网页/深度搜索,可模拟点击、输入、滑动操作未开放 API 的传统软件。MobileWorld 82.1%、真机 92.2%、WebArena 73.6%。
💡 "屏幕当成最大接口"——智能体从工具调用者变为数字设备通用执行器。
来源:阿里千问官方公众号 / 快科技 / IT之家(2026-08-20)

8. Slack Code 上线:把 AI 编程从"单人终端"搬进"团队频道"

⏱ 时效:2026-08-20
Salesforce 在 Slack 推出 Slack Code,频道内 @ Claude Code / Devin / Copilot / Vercel Agent 即建"代码频道",展示计划、diff、PR、HTML 预览,自动归档审计日志。全套餐免费。
💡 把 Agent 工作流嵌入团队协作中枢,交互范式升级。
来源:The Verge / VentureBeat / TNW(2026-08-20);Marc Benioff X

🤖 具身智能 / 机器人(7 条)

9. 2026 世界机器人大会开幕:373 家企业、3000 件产品、311 款新品

⏱ 时效:2026-08-19 ~ 08-20
以"人机共生、产需共融"为主题在北京亦庄开幕,373 家企业、3000 件产品参展,311 款新品亮相,发布"智能机器人向上向善发展倡议"。工信部副部长辛国斌:以智能化为主线推动创新发展。
💡 具身智能从"能跑会跳"向"能想会干"进化,观察技术风向与产业落地核心窗口。
来源:新华网(2026-08-20)

10. 超维动力 KAI:全球首个人形机器人自主乒乓完整对局(SMASH 2.0,117 自由度)

⏱ 时效:2026-08-19
超维动力携 SMASH 2.0 实现全球首个自主完整对局;KAIBot 本体达全球最高 117 个全身自由度,配套 KAI 世界模型(百万级视频预训练),"一脑多形"跨本体对打。
💡 高速动态场景"感知—决策—控制"全链路自主里程碑。
来源:新华网(2026-08-19/20);央广网世界模型专题(8/20)

11. 宇树发布 7 轴仿生机械臂 R1,起售价 9900 元——万元级价格拐点

⏱ 时效:2026-08-20
"人形机器人第一股"宇树(8/19 登陆科创板 688836)发布首款万元以下机械臂 R1,7 轴、自重 5.5kg、臂展 650mm、负载 2kg、精度约 0.1mm,将开源控制程序与接口协议。
💡 把协作机械臂门槛砍掉一个数量级,复刻"低价硬件+开源生态"打法。
来源:新浪财经 / PChome / 电子发烧友(2026-08-20);China News(8/20)

12. 北京人形机器人创新中心发布 Pelican Unify 1.0 + 天工 Omni

⏱ 时效:2026-08-19 ~ 08-20
发布具身多模态大模型 Pelican-Unify 1.0(感知—理解—决策—执行),首发超智能新物种 天工 Omni(轻量化小人形开放平台,演示梅花桩、上下楼梯、匍匐爬行,开放底层接口)。
💡 从"功能拼凑"迈入"协同进化",开放平台降低二次开发与真机部署门槛。
来源:新华网 / 光明日报(2026-08-19/20)

13. 全国首个具身机器人演出"沙盒审批"落地北京经开区

⏱ 时效:2026-08-20
为 3 家企业颁发具身机器人演出沙盒审批准入,上线全国首个全流程管理系统(入盒—审查—试验—监督—出盒),首批接入 7 台机器人、14 名安全员、16 套监控探头。
💡 补"制度基础设施"——监管路径清晰度成为落地速度关键变量。
来源:央广网 / 新京报(2026-08-20)

14. 环球时报探访:中国人形机器人"务实转身",上半年出货超 4 万台、全球占 97%

⏱ 时效:2026-08-21
跳舞机器人少了、干活多了。开普勒"大黄蜂"搬运 30kg 上岗工厂并出口美德奥;星海图超市拣货、擎朗洗衣叠衣完成完整流程。大会报告:2026 上半年中国人形机器人出货超 4 万台,全球占比 97%。
💡 产业进入下半场,三问变"能不能干活、能不能规模化、客户愿不愿持续付费"。
来源:环球时报(2026-08-21)

15. 行业"量产交付"大考:优必选 U1 超 1.3 万订单 9 月交付

⏱ 时效:2026-08-15 ~ 08-20
智身科技累计量产破 1.5 万台(6 月单月 5000+);优必选 U1 全渠道订单破 13361 台、9 月交付;星动纪元二季度千台级交付、增速 300%。上半年全球出货约 1.91 万台,中国占 97%+。
💡 从"Demo"转向"量产";但"签约≠交付≠稳定运营≠复购",良率/一致性才是真考验。
来源:中国经营报 / 世界机器人大会(2026-08-15/20)

二、社区快讯(待验证 · 单列)

①(待验证/低置信度)DeepSeek V3.1 发布(8/20 晚,聚合号):据称整合 V3 快答与 R1 推理、上下文扩至 128K、加 strict Function Calling。非官方聚合号,缺官方公告印证,建议以 DeepSeek 官方为准。
②(社区观察)Reddit r/LocalLLaMA 个别用户反馈 Flash-0731 "overfit to coding":偶发陷入推理循环,属一手体验非缺陷定论,缺大规模独立复现
③(社区线索已部分印证)X/@Wes Roth 8/6 截图:定价通知由"峰谷"改为"显著上涨",与 8/17 官方峰谷定价方向一致,具体涨幅以官方公告为准。

三、DeepSeek 专项(今日有 D ✅)

今日有 D 今日检索到多条 DeepSeek 信息,故非"今日无D"
#事件时效 / 来源
1DeepSeek Harness RC.8 更新:多模态 + 收编 Claude Code/Codex 子代理(见精选 #2;HN 登顶、最快破 2 万 Star)8/21 · 36氪/腾讯研究院
2服务崩溃约 12 小时已恢复:昨夜今晨大量用户"服务器繁忙/无法新对话",截至发稿已恢复(已确认当日真实事件8/21 · 中新经纬
3"价格屠夫收刀"叙事:反向上调 V4 旗舰价(高峰输出约 27 元/百万 tok,约原价 4.7 倍),业界现"DeepSeek 死亡之谷"说法8/21 · 钛媒体/36氪
4(次级·待核验)DeepSeek V3.1 发布8/20 晚 · 聚合号

四、AI 多项能力评分(多源交叉)

llm-stats「综合分」与 LiveBench「Overall」算法/量纲不同,数值不可直接相减,并列呈现供交叉参考。LiveBench = 2026-06-25 release(污染无关 23 任务)。

4.1 llm-stats 综合智能(2026-08-21 实时 · 全榜 358 模型)

排名模型综合分推理编码Agent上下文许可
1GPT-5.6 Sol57.456.950.644.41.1M闭源
2Claude Opus 556.355.442.741.51.0M闭源
3Claude Fable 556.153.748.842.81.0M闭源
4Kimi K354.953.945.941.61.0M开源
5GLM-5.3(NEW)54.754.945.441.8753B闭源
6DeepSeek-V4-Pro-081354.252.243.340.31.0M开源
7Qwen3.8 Max53.352.042.340.02.4T开源
8GPT-5.6 Terra52.951.246.340.81.1M闭源
9Claude Opus 4.851.951.443.937.01.0M闭源
10Muse Spark 1.151.852.437.938.01.0M闭源
11Gemini 3.7 Flash51.250.138.636.01.0M闭源
12Claude Sonnet 549.649.140.134.01.0M闭源
13GPT-5.549.348.641.234.71.1M闭源
14Grok 4.547.545.839.434.1500K闭源
15DeepSeek-V4-Flash-073147.41.0M开源

4.2 LiveBench 综合智能(2026-06-25 release · Max/High Effort)

模型Overall推理编码Agentic数学数据语言指令$/任务
Claude Fable 583.089.786.062.296.080.590.775.81.439
GPT-5.6 Sol81.091.783.956.296.279.887.771.80.515
GPT-5.5 Thinking80.289.782.154.095.981.687.470.70.435
Claude 5 Opus80.191.281.465.295.774.688.763.80.699
Kimi K3(开源)79.290.781.462.284.478.785.571.40.348
Gemini 3.7 Flash78.887.878.958.393.568.085.579.90.157
Qwen 3.8 Max(开源)78.588.272.964.691.378.479.774.10.275
Grok 4.678.090.576.857.092.673.983.771.90.207
GPT-5.6 Terra77.990.678.254.994.979.382.964.60.352
DeepSeek-V4-Pro-0813(开源)77.485.777.254.995.179.282.167.70.044
Claude Opus 4.876.289.281.850.594.366.079.772.00.983
Claude Sonnet 576.088.780.759.492.971.775.063.90.505
GLM-5.2(开源)73.278.679.751.889.873.776.262.30.225
DeepSeek-V4-Flash-0731(开源)74.286.675.046.886.879.379.265.50.060
开源头部:DeepSeek-V4-Pro-0813(LB 77.4)、Kimi K3(79.2)、Qwen 3.8 Max(78.5)已逼近闭源第一梯队;DeepSeek V4 Pro「每成功任务成本」0.044 美元居全球最低档之一。

五、价格表

5.1 主流模型 API 价格($/M 综合价 · llm-stats 2026-08-21)

模型输入 $/M输出 $/M上下文许可
GPT-5.6 Sol5.0030.001.1M闭源
Claude Opus 55.0025.001M闭源
Claude Fable 510.0050.001M闭源
GPT-5.55.0030.001.1M闭源
Claude Opus 4.85.0025.001M闭源
Claude Sonnet 52.0010.001M闭源
GPT-5.6 Terra5.00*30.00*1.1M闭源
Grok 4.52.006.00500K闭源
Kimi K3(开源)3.0015.001M开源
Gemini 3.5 Flash1.509.001M闭源
Gemini 3.6 Flash1.507.501M闭源
GPT-5.21.7514.00400K闭源
GPT-5.3 Codex1.7514.00400K闭源
DeepSeek-V4-Pro-0813(开源)见 5.2见 5.21M开源
DeepSeek-V4-Flash-0731(开源)0.090.181M开源
GLM-5.2(开源)0.953.001M开源
Kimi K2.6(开源)0.753.50262K开源

5.2 DeepSeek V4 官方峰谷定价(CNY · 2026-08-17 00:00 生效)

型号时段缓存命中输入缓存未命中输入输出(元/百万 tok)
V4-Pro高峰 9–12 / 14–180.309.027.0
V4-Pro空闲(其余)0.154.513.5
V4-Flash高峰9.0
V4-Flash空闲4.5
高峰价为空闲价 2 倍;V4-Pro 输出由 6→27 元(+350%)。约 27 元 ≈ $3.8/M,仍显著低于 Claude 5($25–50/M)、GPT-5.6 Sol($30/M)。来源:中国金融新闻网/腾讯新闻(8/17) + @Wes Roth X 截图(8/6) 提前预告。

5.3 LiveBench 每成功任务成本(USD · 2026-06-25 release 节选)

模型$/成功任务
Grok Build 0.10.024
DeepSeek V4 Flash 0731(开源)0.060
DeepSeek V4 Pro 0813(开源)0.044
GPT-5.4 Nano (xHigh)0.091
Gemini 3.7 Flash (High)0.157
Kimi K2.6 Thinking(开源)0.169
GPT-5.6 Luna (Max)0.169
Qwen 3.8 Max(开源)0.275
GPT-5.5 Thinking (xHigh)0.435
Claude Opus 5 (Thinking Max)0.699
Claude Fable 5 (Max)1.439

六、Price vs Performance(性价比 · 分/美元 · llm-stats 当日)

计算口径:性价比 = llm-stats 综合分 ÷ Pricing $/M(综合价)。DeepSeek V4 Pro 以 112.9 分/美元断崖第一;若按输出价口径 V4-Flash 约 260+ 分/美元(全球最低成本档)。闭源旗舰普遍 4–20 分/美元,"DeepSeek 死亡之谷"由此而来。
DeepSeek-V4-Pro-0813
112.9
Gemini 3.7 Flash
47.4
Muse Spark 1.1
32.8
Grok 4.5
19.5
Claude Sonnet 5
17.2
GPT-5.6 Terra
17.0
Kimi K3
12.7
Claude Opus 5
7.8
GPT-5.6 Sol
7.4
GPT-5.5
6.3
Claude Fable 5
3.9
条形长度按最大值 112.9 归一化。数据来源:llm-stats.com(2026-08-21)。

七、GitHub 热门 AI 项目(weekly · 2026-08-21)

#仓库本周新增 ⭐语言方向
1cathrynlavery/diagram-design+11.3kHTML为 Claude Code/Codex/Pi 提供 38 种编辑型图表
2public-apis/public-apis+11.3kPython免费 API 汇总(AI 项目常用)
3harry0703/MoneyPrinterTurbo+9.7kPythonAI 一键生成短视频
4volcengine/OpenViking+2.4kPython面向 Agent 的自进化上下文数据库(记忆/RAG)
5semantica-agi/semantica+3.7kPython图形原生基础设施,可问责 AI
6cactus-compute/needle+3.4kPython14MB 基础模型跑机器人等微型设备(具身/边缘)
7unslothai/unsloth+3.3kPython本地运行/训练 LLM(Qwen/Gemma/DeepSeek)
8akitaonrails/ai-memory+2.0kRust编程 Agent CLI 长期记忆、跨厂商交接
9CodebuffAI/freebuff+1.1kTS免费 AI 编程智能体
10NVIDIA-NeMo/Switchyard+0.9kRustLLM 跨模型/供应商路由
信号:AI Coding 仍是开源最热赛道(diagram-design/freebuff/ai-memory 集中上榜);具身/边缘方向出现 needle(14MB 模型跑机器人);deepseek-harness 本周在 Agent 编排类持续霸榜。来源:github.com/trending?since=weekly(2026-08-21)。

八、数据来源与时效说明

llm-stats.comLiveBench 2026-06-25Artificial Analysis v4.1.1 新智元网易财联社彭博 36氪InfoQ新华网央广网 环球时报科技日报腾讯研究院中新经纬 Hacker NewsX(Twitter)Reddit r/LocalLLaMAGitHub Trending