🤖 AI 日报 · 2026-08-23(周日)

生成时间:2026-08-23 10:20 CST(更新版 / 第九次生成)

覆盖窗口:2026-08-21 18:00 — 2026-08-23 10:20 CST

侧重方向:AI Coding · 具身智能

实时数据源(本次全部现场抓取,非缓存)

· llm-stats.com 首页嵌入数据 — 抓取于 10:06 CST,全榜 359 款模型

· livebench.ai table_2026_06_25.csv + cost_2026_06_25.csv — 抓取于 10:12 CST,46 款模型 × 23 子项

· artificialanalysis.ai 首页嵌入数据 — 抓取于 10:15 CST,28 款模型(Intelligence Index v4.1)

· GitHub Search API 日榜(AI 专项 + 综合)— 抓取于 10:32–10:34 CST

本次更新要点:今日 09:00 版发出后,新增交叉核验到 Ox Alpha 匿名模型已被 LiveBench 正式收录,审计分数与社区疯传的"碾压 Fable 5"存在重大落差(详见第 2 条与「社区快讯」)。此为本版最重要的新增结论。

📑 目录 (👆 点击左侧「一 ~ 七」章节号,本页就地跳转到对应位置)

章节内容条目数
社区信源监控(X / Reddit / HN / 微博 一手线索 + 验证状态)18 条线索
DeepSeek 专项 —— 今日有 D ✅D1–D7
今日 15 条精选(AI Coding 8 条 + 具身智能 7 条)15 条
社区快讯(单源未交叉验证,单列)S1–S5
能力评分与价格表(LiveBench 46 款 / AA 28 款 / llm-stats 359 款 / Price vs Performance)4 张表
GitHub 当日趋势榜(AI 专项 + 综合)27 项目
AI 社会效益(就业 / 教育 / 医疗 / 政务 / 科研普惠 / 风险治理)动态条目
AI 经济效益(投融资 / 产业规模 / 企业降本 / 区域 GDP / 资本市场)动态条目
方法论、信源分级规则与免责声明

一、社区信源监控(今日一手线索,快于媒体)

原则:重大动态先在社区发酵,媒体报道有延迟。以下为本次实际检索到的社区一手线索及其验证状态。

平台账号 / 帖子时间线索验证状态
X (Twitter)@davis7(Ben Davis)8/21 约 12h 内Ox Alpha 在 DeepSWE 10 项任务通过率 ~80%,超 Fable 5 (65%)、GPT-5.6 Sol (52%)⚠️ 个人 10 任务小样本,已被 LiveBench 审计数据部分否证
X (Twitter)@Thibault Sottiaux(Codex & ChatGPT @OpenAI)8/23Codex "banked reset" 已对全部付费用户上线;官方承认本周部分用户缓存命中率下降已确认(OpenAI 官方成员发声)
X (Twitter)@Thariq(Claude Code @Anthropic)8/23Anthropic 内部常用 ELI5 skill,生成"大图少字"HTML 工件解释复杂概念✅ 已确认(Anthropic 员工一手)
X (Twitter)@Guillermo Rauch(Vercel CEO)8/23Vercel 循环运行 is-agenic 测试直至 100/100,用 AI 自查产品缺口✅ 已确认(CEO 一手)
X (Twitter)@OpenRouter / @opencode8/20Ox Alpha 上线:1M 上下文、文本/图像/视频、免费一周、零数据留存;OpenCode 备 100 万亿 token/日容量✅ 已确认(平台官方)
X (Twitter)@itsmja00(Mart)8/21–22gist 分析结论"This bad boy is a GLM based model"🟡 大概率属实(多源印证)
X (Twitter)@aitrackerbot8/224 段视频测试,视频编码器 token 消耗模式匹配 GLM-5V-Turbo🟡 大概率属实
X (Twitter)@ornith_48h 内Ornith-1.5 开源 MIT 协议,最大 397B MoE,自改进循环自造任务训练⚠️ 单源待验证
Redditr/LocalLLaMA · u/Miserable-Dare50908/21–22发布 Ox Alpha 跑分,社区推测 GLM5 Air / Mimo V3🟡 讨论中
Redditr/LocalLLaMA · 帖 1sprdm88/22llama.cpp speculative checkpointing 已合并✅ 已确认(可查 ggml-org/llama.cpp)
Redditr/LocalLLaMA · SOC_FreeDiver(157↑) / Healthy-Nebula-3603(136↑) / on_line187 / TrifleHopeful54188/21–22Qwen3.8-27B 本地实测:弃 Claude Code 改用 27B+pi;PI Agent 优于 Opencode;机械评分 GSM8K 96.7% / MATH-500 86.4%(2×RTX 3090);262K 上下文 9.5→153 tok/s🟡 多人独立实测互印
Redditr/AI_Agents · triumph-17018/21"1 个强 agent + 1 个 fresh-context reviewer" 优于 5-agent swarm✅ 观点已被学术数据佐证
Redditr/ClaudeAI · u/Oneirathon1 (41↑)8/21–22批评 Claude Opus 5 "hostile",爱挑刺、对话变成"管理它的批评"⚠️ 主观体感,非跑分
Redditr/MachineLearning8/22SHADOW-250M:250M 参数 / 30B token,亚 2-bit 量化后 60MB,可检索 100M token 磁盘历史⚠️ 单人项目,未第三方复现
Hacker News / 聚合Agent Brief 2026-08-218/21汇总上述 Reddit 线索🔵 线索入口(非唯一信源)
中文社区微博 @AIGC日报 / @编程模型观察8/23"Codex 成蓝领主力、Claude 跌落神坛"格局论⚠️ 社区观点,非官方数据
开发者博客Simon Willison8/22llm 0.32.1 + llm-openrouter 0.7(新增 Shell/WebFetch/WebSearch 服务端工具);警告 Qwen3.8-27B "defaults to wildly overthinking"✅ 已确认(作者本人发布)

二、DeepSeek 专项 —— 今日有 D ✅(非"今日无D")

DeepSeek 今日状态:有 D ✅(非"今日无D")
共 7 条动态(D1–D7):API 周末低谷价生效 · V4-Pro 正式版打通 Responses/Codex · V4-Flash-Vision-Exp 上线 · 自验证框架论文 · Harness 手机版 · 梁文锋昇腾 950 表态 · 行业涨价研报。三口径评分位置:LiveBench 综合 78.2(#13)/ AA 智能指数 53.2 / 性价比 143.7 分每美元。

今日 DeepSeek 相关动态密集,且有官方公告级证据,故不适用"今日无D"。

#事件时效来源置信度
D1API 周末计费改革:2026-08-23 00:00 起,周六、周日全天不再区分峰谷,统一按低谷价计费。工作日仍维持峰谷分段(高峰 9:00–12:00、14:00–18:00)。以 V4-Pro 为例,周末输出价由高峰 27 元 → 13.5 元/百万 tokens,成本直接腰斩今日生效(8/23 00:00)DeepSeek 官方邮件公告;IT之家、TechWeb、DoNews 8/22–23✅ 已确认
D2V4 Pro 正式版上线 API:模型名不变,Agent 能力显著增强,支持 Responses API 与 Codex 接入。Terminal Bench 87.9(Fable 5 为 88.0);CyberGym、AutomationBench 两项高难度智能体评测反超 Fable 58/22–23DoNews、微博 AIGC 日报✅ 已确认
D3V4 Flash Vision Exp 多模态:视觉基准 ALE、ZeroBench 超越 Opus 4.8;看图成本低至1 分钱约 9 张8/21 上线 / 8/22 报道至顶科技;llm-stats 已收录(release_date 2026-08-21)✅ 已确认
D4自验证框架(LLM-as-a-Verifier):GitHub 热榜项目,使 V4 Flash 在 Terminal-Bench 2.1 反超 Fable 5,单任务成本仅 $0.118/22InfoQ🟡 大概率属实
D5Harness 手机版实测:三种开源方案,最激进者可直接在 Android 装 App,关电脑后仍自主执行任务8/22蔚公子说AI(社区实测)🟡 社区实测,待更多复现
D6梁文锋谈国产芯片:称华为昇腾 950 超节点可平替英伟达 GB200/GB300,预计一年内扭转"国产芯片不好用"印象8/22驱动之家(转述)⚠️ 转述,未见原始一手发言
D7行业价格拐点:摩根士丹利研报《告别价格战,打响智力战》——2026Q2 中国大模型平均 API 输入价升至 4.9 元/百万 Token、输出 21.9 元,较 2025Q1 的 3.3 / 12.2 元分别涨约 48% / 80%。阿里云、腾讯云、百度智能云、智谱均已跟进调价8/22–23摩根士丹利、开源证券、中银证券(经 DoNews 汇总)✅ 已确认

DeepSeek 实时评分位置(三口径交叉,均为今日抓取)

口径模型分数排名成本
LiveBench 2026-06-25DeepSeek-V4-Pro-081378.2全榜 #13 / 46$0.0442/成功任务(全榜最低档)
LiveBench 2026-06-25DeepSeek-V4-Flash-Vision-Exp77.7#15 / 46$0.0505/成功任务
Artificial Analysis v4.1DeepSeek V4 Pro 0813 (Reasoning)Intelligence 53.2 / Agentic 49.6#11 / 28$0.252/task
llm-stats(今日)DeepSeek-V4-Pro-0813HLE 0.600 · 吞吐 193.7 tok/s开源头部$0.435 in / $0.87 out

关键洞察:DeepSeek V4 Pro 以约 1/33 的每任务成本($0.0442 vs Fable 5 的 $1.4777)取得 LiveBench 78.2 分(Fable 5 为 83.4),差距 5.2 分而成本差 33 倍。这也解释了它为何有底气连续两次调价——它调的是"价值定价",不是"价格战"。


三、今日 15 条精选

▍AI Coding(8 条)

1. Ox Alpha 匿名模型登陆 LiveBench——审计分数与社区疯传落差巨大【本版最重要新增】

2. DeepSeek API 周末全天低谷价,今日 00:00 生效

3. Anthropic 全面开放 Claude 平台三大 API:Computer Use / Skills / Files

4. Codex "banked reset" 全量上线,OpenAI 同时承认缓存命中率下降

5. DeepSeek V4 Pro 正式版打通 Responses API 与 Codex

6. 实证研究给多智能体架构降温:协调税吃掉收益

7. Qwen3.8-27B 成本地编码 agent 新宠,但赢在 harness 不在模型

8. 编程模型格局剧变:Codex 成"蓝领"主力,Opus 5 遭"hostile"批评


▍具身智能(7 条)

9. 2026 世界机器人大会收官:机器人从"舞台炫技"走向"上岗打工"

10. 工信部与新华社披露硬数据:上半年出货超 4 万台,全球占比 97%

11. 优必选把客户真实产线 1:1 搬进展台,连续 8 小时无干预作业

12. 云蝶科技发布 RoboForge 系统级具身大脑,Embodied Bench 获全球第一

13. 资本焦点转向数据资产:上半年融资 935 亿元,全国 90 个数采中心

14. 第二届世界人形机器人运动会规模翻倍,新设"灵巧手"精细操作赛项

15. 落地长尾涌现:"80-20"人机协同、RaaS 租赁、中试驱动、太空具身智能


四、社区快讯(待验证 / 低置信度)

以下线索重要但尚未获得官方或双源交叉确认,单列以避免污染上方已确认条目。

S1. Ox Alpha 身份指向智谱(Z.ai)—— 🟡 大概率属实,缺官方承认

  1. 8/21 开发者 dax 对 25 个提示词做 tokenizer 指纹分析,Ox Alpha token 计数与 GLM-5.3 几乎完全吻合,仅存在恒定 75 token 的包装层偏差(据 ExplainX.ai 记录)
  2. 8/22 研究者 @aitrackerbot 用 4 段视频匹配视频编码器 token 消耗模式,指向 GLM-5V-Turbo
  3. 8/22(最强证据)研究者 Chetaslua 向 OpenCode 的 Ox Alpha 直连路由发送畸形请求(将 top_p 设为字符串 "abc"),服务器返回 Java 堆栈跟踪,暴露内部类名 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest —— 该包路径直接对应智谱在 open.bigmodel.cnapi.z.ai 的已公开 API 路由
  4. 错误码 1214(无效 role 参数)在 Ox Alpha 与 Z.AI 托管的 GLM 模型上完全一致,而 DeepInfra 托管的 GLM-5.2 不一致——同权重、不同运营方、不同错误方言,构成关键对照组

S2. Ornith-1.5 开源自改进 397B MoE —— ⚠️ 单源待验证

S3. Google DeepMind × FenrisCreations 持续学习游戏世界 —— ⚠️ 单源

S4. SHADOW-250M:60MB 装下可检索 100M token 的模型 —— ⚠️ 单人项目未复现

S5. 其他待观察线索

线索来源/时效状态
苹果计划裁减 Siri 与 Vision Pro 团队 200+ 岗位界面新闻 8/22🟡 公司已声明"做出调整",具体数字未官方确认
特斯拉 9 月 3 日 首秀 Cybercab8/22–23 多家🟡 日期待官方最终确认
llama.cpp speculative checkpointing 已合并r/LocalLLaMA 1sprdm8,8/22✅ 可在 ggml-org/llama.cpp 直接核验
NVIDIA 跨模型 KV cache 线性映射迁移(免全量 re-prefill)技术聚合,8/22🟡 待原始论文链接
Simon Willison llm 0.32.1 / llm-openrouter 0.7(新增 Shell/WebFetch/WebSearch 服务端工具)作者博客 8/22✅ 已确认
中国 AI 相关产业 2026Q2 对 GDP 增长贡献率达 26.0%(较 Q1 +5.6pp)央行 Q2 货币政策执行报告✅ 官方报告
我国智能算力规模达 2185 EFLOPS;日均词元调用量约 140 万亿中国信通院《绿色算力发展研究报告(2026)》,8/22✅ 官方报告


五、截至今日 AI 多项能力评分表(三口径交叉验证)

数据抓取时间:2026-08-23 10:07–10:15 CST(现场抓取,非缓存)

三大口径:① LiveBench 官方 CSV table_2026_06_25.csv(46 款,23 个子项聚合为 6 大能力维度,含每成功任务成本);② Artificial Analysis v4.1(28 款,Intelligence Index / Agentic Index);③ llm-stats.com 实时价格与吞吐(359 款)

口径差异说明:LiveBench 为「防污染动态题库审计分」,AA 为「10 项基准加权综合指数」,两者排名不完全一致属正常;llm-stats 价格为各家官方 list price(美元 / 百万 token)。

5.1 LiveBench 2026-06-25 多维能力评分(Top 25 / 共 46 款)

#模型综合推理编码Agent编码数学数据分析语言输入价输出价每成功任务成本
1claude-fable-5-max-effort83.491.686.062.296.081.476.4$10.00$50.00$1.4777
2gpt-5.6-sol-max81.692.883.956.296.277.873.3$5.00$30.00$0.5070
3gpt-5.5-xhigh80.891.282.154.095.981.371.4$5.00$30.00$0.4356
4claude-opus-5-max-effort80.590.381.465.295.779.466.0$5.00$25.00$0.7067
5gemini-3.7-flash-high79.985.378.958.393.577.877.2$0.75$3.75$0.1571
6smaug-agentic79.791.982.564.683.977.171.0$3.00$15.00$0.3288
7qwen3.8-max79.589.172.964.691.378.071.0$2.00$6.00$0.2750
8kimi-k379.592.181.462.284.476.871.6$3.00$15.00$0.3510
9grok-4.679.090.076.857.092.675.870.9$2.00$6.00$0.2068
10muse-spark-1.2-xhigh78.990.477.557.691.273.671.8$1.25$4.25$0.3753
11gpt-5.4-xhigh78.889.877.553.894.177.969.4$2.50$15.00$0.3874
12gpt-5.6-terra-max78.690.578.254.994.978.865.6$2.50$15.00$0.3437
13deepseek-v4-pro-081378.288.977.254.995.176.567.0$0.43$0.87$0.0442
14gemini-3.1-pro-preview-high78.086.976.544.191.077.578.1$2.00$12.00$0.2852
15deepseek-v4-flash-vision-exp77.788.568.265.187.877.568.3$0.22$0.66$0.0505
16claude-opus-4-8-max-effort77.184.881.850.594.374.470.0$5.00$25.00$0.9858
17grok-4.577.187.068.656.590.875.970.5$2.00$6.00$0.1305
18claude-opus-4-7-xhigh-effort77.088.482.150.792.975.165.7$5.00$25.00$0.5282
19claude-sonnet-5-xhigh-effort76.687.580.759.492.972.261.8$3.00$15.00$0.5134
20muse-spark-1.1-xhigh76.086.777.258.587.169.568.3$1.25$4.25$0.1952
21qwen3.8-27b75.882.675.761.486.273.669.4$0.27$0.65$0.0939
22gemini-3.5-flash-high75.479.378.249.088.277.574.0$1.50$9.00$0.2489
23gpt-5.2-2025-12-11-high75.286.876.150.393.275.961.1$1.75$14.00$0.2336
24claude-opus-4-6-thinking-auto-high-effort75.186.278.249.089.376.763.9$5.00$25.00$0.4035
25deepseek-v4-flash-073174.888.975.046.886.876.864.1$0.14$0.28$0.0596
展开 #26–#46(含今日新增 ox-alpha 系列)
#模型综合推理编码Agent编码数学数据分析语言每成功任务成本
26gemini-3.6-flash-high74.580.777.943.486.477.773.0$0.2353
27qwen3.7-max74.183.674.243.685.275.971.0$0.1816
28gpt-5.2-codex74.082.583.649.488.871.964.4$0.1874
29gpt-5.6-luna-max73.787.682.948.487.272.558.3$0.1677
30claude-sonnet-4-6-thinking-auto-medium-effort73.488.579.342.687.071.162.0$0.3062
31glm-5.273.481.379.751.889.872.062.0$0.2246
32claude-opus-4-5-20251101-thinking-64k-high-effort72.983.279.739.790.474.063.3$0.6104
33inkling-xhigh72.979.171.049.488.474.866.7$0.3110
34deepseek-v4-pro72.684.070.042.690.776.161.2$0.0498
35kimi-k2.6-thinking70.976.478.646.984.374.063.1$0.1687
36gpt-5.4-nano-xhigh70.878.870.846.891.067.561.6$0.0911
37ox-alpha-max69.276.375.852.677.573.658.8$0.0000
38qwen3.6-plus69.076.878.241.483.774.957.2$0.2273
39kimi-k2.7-code68.879.674.045.779.673.256.2$0.1002
40grok-build-0.168.676.565.445.878.474.262.9$0.0240
41minimax-m367.579.868.240.776.976.056.0$0.0597
42gpt-5.4-mini-xhigh66.674.571.641.778.573.156.6$0.3343
43deepseek-v4-flash66.172.069.237.679.672.759.9$0.0161
44qwen3.6-27b64.271.471.839.379.970.351.1$0.2017
45gemini-3.5-flash-lite-high63.859.076.145.373.770.963.7$0.0686
46grok-4.363.367.669.918.584.372.459.9$0.0614

5.2 Artificial Analysis v4.1 智能指数 / Agent 指数(28 款全量)

#模型智能指数Agent指数全知度输入价输出价混合价每任务成本输出速度发布日
1Claude Opus 5 (max)63.159.237.1$5.00$25.00$10.00$2.33755.52026-07-24
2Claude Fable 5 (with fallback)62.156.643.3$10.00$50.00$20.00$3.14070.52026-06-09
3GPT-5.6 Sol (max)60.957.822.0$5.00$30.00$11.25$1.23171.82026-07-09
4Grok 4.6 (high)60.958.730.5$2.00$6.00$3.00$0.83769.42026-08-12
5Kimi K3 (max)59.754.319.7$3.00$15.00$6.00$0.83737.22026-07-16
6GLM-5.3 (max)59.559.114.3$1.40$4.40$2.15$0.683102.12026-08-18
7Qwen3.8 2.4T A95B57.757.14.3$2.00$6.00$3.00$1.09245.12026-08-12
8Muse Spark 1.2 (xhigh)56.849.327.2$1.25$4.25$2.00$0.3992026-08-05
9GPT-5.6 Terra (max)56.650.20.1$2.00$12.00$4.50$0.508116.72026-07-09
10Gemini 3.7 Flash (high)56.045.126.5$0.75$3.75$1.50$0.402373.32026-08-13
11DeepSeek V4 Pro 0813 (max)53.249.60.8$1.32$3.96$1.98$0.25276.82026-08-13
12GPT-5.6 Luna (max)52.346.9-10.3$0.20$1.20$0.45$0.047148.72026-07-09
13Qwen3.8 27B (xhigh)52.050.9-10.0$0.50$3.00$1.12$0.25355.72026-08-14
14Motif 347.437.610.22026-08-12
15MiniMax-M345.436.11.4$0.30$1.20$0.52$0.139105.02026-06-01
16Inkling42.334.12.0$1.00$4.05$1.76$0.33979.52026-07-15
17Nemotron 3 Ultra38.327.5-0.4$0.60$2.75$1.14$0.383145.12026-06-04
18Gemini 3.5 Flash-Lite37.427.25.2$0.30$2.50$0.85$0.097407.12026-07-21
19Solar Open2 250B37.427.8-1.82026-08-12
20Muse Glimmer (high)35.122.9-32.9$0.32$1.35$0.58$0.073105.62026-08-10
21A.X-K235.025.7-8.22026-08-12
22K-EXAONE 2.031.019.7-6.62026-08-12
23Mistral Medium 3.530.419.2-36.8$1.50$7.50$3.00$0.464150.52026-04-29
24Claude 4.5 Haiku29.916.5-4.4$1.00$5.00$2.00$0.21796.92025-10-15
25Nemotron 3 Super25.78.8-41.5$0.20$0.80$0.35$0.229144.12026-03-11
26gpt-oss-120b (high)24.113.4-49.2$0.15$0.60$0.26$0.073172.12025-08-05
27Nemotron 3.5 Lightning23.613.8-17.7$0.07$0.22$0.11$0.076312.12026-08-11
28Command A+22.89.2-4.0$0.00$0.00$0.00$0.000201.42026-05-20

5.3 llm-stats.com 实时价格 / 吞吐表(DeepSeek 全系 + 2026-06 以来全部新模型)

说明:从 llm-stats.com 当日抓取的 359 款模型中筛出 DeepSeek 全系2026-06-01 以来发布且已公开定价 的模型;HLE = Humanity's Last Exam 得分。

模型厂商输入价 $/M输出价 $/M吞吐 tok/s上下文HLE开源发布日
DeepSeek-V4-Flash-Vision-ExpDeepSeek0.2200.6601048K2026-08-21
DeepSeek-V4-Pro-0813DeepSeek0.4350.870193.71048K60.0%2026-08-13
DeepSeek-V4-Flash-0731DeepSeek0.0900.180174.81048K2026-07-31
DeepSeek-V4-Pro-MaxDeepSeek1.6003.2001048K48.2%2026-04-23
DeepSeek-V4-Flash-MaxDeepSeek0.1400.2801048K45.1%2026-04-23
DeepSeek-V4-Flash-0423DeepSeek0.1000.20063.81048K40.3%2026-04-23
DeepSeek-V3.2 (Non-thinking)DeepSeek0.2800.420131K2025-12-01
DeepSeek-V3.2-SpecialeDeepSeek30.6%2025-12-01
GLM-5.3Zhipu AI1.4004.4001000K62.5%2026-08-14
Gemini 3.7 FlashGoogle0.7503.750626.01048K2026-08-13
Grok 4.6xAI2.0006.00050.3500K2026-08-12
MAI-Code-1.1-FlashMicrosoft0.2001.200256K2026-08-11
Nemotron 3.5 Lightning (30B A3B)NVIDIA0.0500.200262K11.7%2026-08-11
GPT-5.6 CyberOpenAI12.50075.000400K2026-08-10
Solar Pro 4Upstage0.3001.200524K2026-08-06
Muse Spark 1.2Meta0.1000.200129.61048K2026-08-05
Sakana NamazuSakana AI0.9504.000256K2026-08-03
Inkling-SmallThinking Machines Lab0.3001.200256K31.6%2026-07-30
Claude Opus 5Anthropic5.00025.00058.21000K64.7%2026-07-24
Gemini 3.6 FlashGoogle1.5007.500281.31048K2026-07-21
Gemini 3.5 Flash-LiteGoogle0.3002.5001048K2026-07-21
Laguna S 2.1Poolside0.1000.2001048K2026-07-21
Kimi K3Moonshot AI3.00015.000134.61048K56.0%2026-07-16
Grok 4.5xAI2.0006.000500K2026-07-16
GPT-5.6 SolOpenAI5.00030.000102.41050K2026-07-09
GPT-5.6 TerraOpenAI2.00012.000119.01050K2026-07-09
GPT-5.6 LunaOpenAI0.2001.200336.21050K2026-07-09
Muse Spark 1.1Meta1.2504.250228.91048K62.1%2026-07-09
Laguna XS 2.1Poolside0.1000.200262K2026-07-02
Claude Sonnet 5Anthropic2.00010.00059.51000K57.4%2026-06-30
GLM-5.2Zhipu AI0.9503.000155.71048K54.7%2026-06-16
Kimi K2.7 CodeMoonshot AI0.7403.50052.0262K2026-06-12
Claude Fable 5Anthropic10.00050.00078.51000K64.5%2026-06-09
MiniMax M3MiniMax0.3001.2001000K2026-06-01

5.4 Price vs Performance 性价比表(llm-stats 口径 · 当日抓取)

性价比可视化 · 横轴 = LiveBench 综合分 / llm-stats 混合价(分 / 美元,对数感知:条长按线性比例)· 青色 = DeepSeek 系列
左侧括号内为 LiveBench 综合分
deepseek-v4-flash-0731
(74.8)
665.3
muse-spark-1.2-xhigh
(78.9)
631.3
deepseek-v4-flash-vision-exp
(77.7)
235.6
gpt-5.6-luna-max
(73.7)
163.7
deepseek-v4-pro-0813
(78.2)
143.7
minimax-m3
(67.5)
128.6
gemini-3.7-flash-high
(79.9)
53.3
glm-5.2
(73.4)
50.2
grok-4.6
(79.0)
26.3
grok-4.5
(77.1)
25.7
claude-sonnet-5-xhigh-effort
(76.6)
19.1
gpt-5.6-terra-max
(78.6)
17.5
kimi-k3
(79.5)
13.2
claude-opus-5-max-effort
(80.5)
8.0
gpt-5.6-sol-max
(81.6)
7.3
claude-fable-5-max-effort
(83.4)
4.2

计算方式:混合价 = (输入价x3 + 输出价) / 4(llm-stats 官方 3:1 混合口径);性价比 = LiveBench 综合分 / 混合价,单位「分 / 美元」。数值越高越划算。

#模型LiveBench综合分输入价 $/M输出价 $/M混合价 $/M性价比(分/$)相对倍数
1deepseek-v4-flash-073174.8$0.090$0.180$0.1125665.3159.6x
2muse-spark-1.2-xhigh78.9$0.100$0.200$0.1250631.3151.4x
3deepseek-v4-flash-vision-exp77.7$0.220$0.660$0.3300235.656.5x
4gpt-5.6-luna-max73.7$0.200$1.200$0.4500163.739.3x
5deepseek-v4-pro-081378.2$0.435$0.870$0.5437143.734.5x
6minimax-m367.5$0.300$1.200$0.5250128.630.9x
7gemini-3.7-flash-high79.9$0.750$3.750$1.500053.312.8x
8glm-5.273.4$0.950$3.000$1.462550.212.0x
9grok-4.679.0$2.000$6.000$3.000026.36.3x
10grok-4.577.1$2.000$6.000$3.000025.76.2x
11claude-sonnet-5-xhigh-effort76.6$2.000$10.000$4.000019.14.6x
12gpt-5.6-terra-max78.6$2.000$12.000$4.500017.54.2x
13kimi-k379.5$3.000$15.000$6.000013.23.2x
14claude-opus-5-max-effort80.5$5.000$25.000$10.00008.01.9x
15gpt-5.6-sol-max81.6$5.000$30.000$11.25007.31.7x
16claude-fable-5-max-effort83.4$10.000$50.000$20.00004.21.0x

关键结论


六、GitHub 当日趋势榜(开源生态风向标)

数据来源:GitHub Search API 实时查询(经 github-ai-trends / github-trending-cn 两个技能脚本)

抓取时间:2026-08-23 10:32–10:34 CST

6.1 AI / ML / LLM 专项日榜(Top 15)

#项目StarFork语言定位
1openclaw/openclaw387.2k81.3kTypeScript跨平台个人 AI 助手(🦞 龙虾派),AI Coding 生态第一热度
2n8n-io/n8n201.8k60.3kTypeScript原生 AI 能力的工作流自动化平台
3Significant-Gravitas/AutoGPT186.8k46.0kPython自主 Agent 元老项目
4f/prompts.chat167.8k21.7kHTMLPrompt 共享社区(原 Awesome ChatGPT Prompts)
5Snailclimb/JavaGuide158.0k46.2kJavaScript后端面试指南,已扩展至「AI 应用开发」章节
6langflow-ai/langflow153.6k9.9kPython可视化 Agent 构建与部署
7langgenius/dify153.2k24.2kTypeScriptAgentic workflow + RAG 平台
8open-webui/open-webui149.6k21.8kPython本地/自托管 LLM 前端事实标准
9langchain-ai/langchain144.8k24.1kPython已改称「the agent engineering platform」
10Shubhamsaboo/awesome-llm-apps133.6k19.7kPython100+ Agent / Agent Skills / RAG 应用合集
11harry0703/MoneyPrinterTurbo114.7k17.4kPython一键生成高清短视频
12browser-use/browser-use110.2k12.1kPython让 Agent 会用浏览器
13supabase/supabase108.3k13.6kTypeScriptPostgres 开发平台(AI 应用后端常选)
14google-gemini/gemini-cli106.6k14.5kTypeScriptGemini 官方终端 Agent
15hacksider/Deep-Live-Cam96.1k14.0kPython实时换脸(争议性热度)

6.2 综合日榜(Top 12,观察 AI 项目占比)

#项目Star语言是否 AI 项目
1freeCodeCamp/freeCodeCamp454.5kTypeScript
2openclaw/openclaw387.2kTypeScript✅ AI 助手
3vinta/awesome-python315.5kPython
4awesome-selfhosted/awesome-selfhosted314.4k
5react/react247.6kJavaScript
6torvalds/linux243.9kC
7NousResearch/hermes-agent234.4kPython✅ 「会成长的 Agent」
8n8n-io/n8n201.8kTypeScript✅ AI 工作流
9anomalyco/opencode200.4kTypeScript✅ 开源编码 Agent
10tensorflow/tensorflow197.3kC++✅ ML 框架
11ohmyzsh/ohmyzsh189.3kShell
12microsoft/vscode189.3kTypeScript

观察结论:综合日榜 Top 12 中 AI 相关项目占 5 席(41.7%)。其中 openclaw(387.2k)已超过 React、Linux Kernel,成为全站第二hermes-agent(234.4k,#7)与 opencode(200.4k,#9)双双进入前十,说明「开源编码 Agent / 通用 Agent」正在取代传统框架成为 GitHub 上最受关注的品类。这与今日精选第 ⑦⑧ 条中「harness(Agent 外壳)比模型本身更决定实际编码体验」的判断相互印证。


八、AI 社会效益(对社会运行与公共福祉的影响)

聚焦 AI 在就业结构、教育科研、医疗健康、政务服务、公共安全、数字鸿沟、风险治理等方面的真实落地与连锁影响。优先采用官方报告、权威媒体与可量化指标,避免泛泛而谈;社区单源线索单列说明。

8.1 今日社会效益要点

#领域事件 / 进展时效来源置信度
1科研普惠"太空龙虾"开源太空具身智能计划启动:超脑未来、未来宇航、希云柔控联合发起全球首个开源太空具身智能项目,目标 6 个月内完成首阶段在轨抓取验证,向科研界开放数据接口8/22–23机器之心、腾讯新闻✅ 已确认
2工业民生民生服务率先领跑具身落地:WRC 2026 大量展区转向真实场景(洗衣房、卧室、物流分拣、饮料零售),中国电子学会判断产业进入"小批量试用→大规模落地"拐点,民生服务领域率先跑通8/23中国青年报、新华社✅ 已确认
3就业结构"80-20→80-10-10"人机协同范式:厦门瑞为"晓蚁"行李转运机器人在华东机场真实航班保障中落地,约 80% 标准行李由机器人处理,20% 异形/破损由人工,目标演进为 80% 专用机器人 / 10% 人形 / 10% 人工兜底8/22–23厦门日报、亿欧网🟡 大概率属实
4风险治理多智能体协调税实证研究:Google / MIT 测试 180 组配置发现,顺序推理任务上多智能体反而降低 39–70% 效率,提示"盲目堆 agent"可能造成算力与社会资源浪费,需回归任务匹配8/21–22r/AI_Agents、Google & MIT 研究🟡 大概率属实
5教育科研本地可跑的开源编码 agent 普及:Qwen3.8-27B 在消费级显卡(24GB)即可运行,Unsloth 1-bit 量化版 8GB RAM 可跑,降低 AI 编程能力获取门槛,利于教学与个人开发者8/21–22r/LocalLLaMA、Simon Willison🟡 大概率属实

关键洞察:本日社会效益主线是"从炫技到上岗"——机器人、Agent 的评判标准正从跑分转向真实岗位胜任力(云蝶"上岗验证"体系、优必选 8 小时无干预产线即典型)。同时需警惕协调税与同质化数据中心的资源浪费风险。

8.2 社会效益待观察线索


九、AI 经济效益(产业价值与资本动向)

聚焦 AI 在投融资、产业规模、企业降本增效、区域 GDP 贡献、资本市场表现等方面的量化数据与趋势。优先官方统计、权威研报与上市公司披露;社区单源线索单列。

9.1 今日经济效益要点

#维度事件 / 数据时效来源置信度
1产业规模上半年机器人产业规模 1655 亿元,同比 +24.5%;2025 全年规上企业营收破 3000 亿元;2030 年人形机器人市场规模有望达约 8700 亿元8/21–23工信部、新华社、中国电子学会✅ 已确认
2投融资上半年具身智能融资 935 亿元,同比增长 5 倍;宇树科技登陆科创板首日收涨 460.34%;资本焦点从本体制造转向数据资产8/19–23IT桔子、科创板日报✅ 已确认
3宏观贡献中国 AI 相关产业 2026Q2 对 GDP 增长贡献率达 26.0%(较 Q1 +5.6pp);智能算力规模达 2185 EFLOPS,日均词元调用约 140 万亿8/22央行 Q2 货币政策执行报告、中国信通院✅ 已确认
4企业降本API 价格拐点:摩根士丹利研报显示 2026Q2 中国大模型平均 API 输入价升至 4.9 元/百万 Token、输出 21.9 元,较 2025Q1 涨约 48% / 80%;但同时 DeepSeek 周末低谷价使批量任务成本腰斩8/22–23摩根士丹利、开源/中银证券(DoNews 汇总)✅ 已确认
5算力基建智能算力 2185 EFLOPS + 国产芯片替代叙事(梁文锋称昇腾 950 超节点可平替 GB200/GB300)——算力成本与自主可控直接影响下游应用经济性和地缘风险8/22中国信通院、驱动之家(转述)🟡 官方报告 + 转述

关键洞察:本日经济效益呈现"量价齐升、结构分化"——产业规模与融资额高速增长,但 API 价格结束价格战、进入"智力战",叠加国产算力替代,意味着应用层降本不再靠模型降价,而靠架构优化(如周末错峰、harness 选型)。宏观层面 AI 已成 GDP 增长重要拉动项(26% 贡献率)。

9.2 经济效益待观察线索


十、方法论与免责声明

7.1 本报告的信源分级规则

级别判定标准本期条目
已确认官方公告 / 官方文档 / 官方定价页 / 权威榜单 CSV精选 ①②③④⑤,DeepSeek D1–D5,全部评分表
🟡 大概率属实≥2 个独立社区源,或 1 社区源 + 1 官媒精选 ⑥⑦⑧⑨⑩⑪⑫⑬⑭⑮,D6–D7
🔴 待验证 / 低置信度仅单一社区源,未交叉验证社区快讯 S1–S5(单列,不进精选)

7.2 时效性说明

7.3 免责声明

  1. 社区快讯段落(§四)中的内容尚未获得官方确认,仅作为线索记录,请勿据此做投资或技术选型决策;
  2. 价格数据为厂商官方 list price,实际成本受缓存命中率、峰谷计费、批量折扣、渠道价影响,可能显著低于表中数值(DeepSeek 周末低谷价即为典型);
  3. 「性价比」指标为本报告自行计算的派生指标(LiveBench 综合分 ÷ llm-stats 混合价),不代表任何官方评价;
  4. 具身智能部分的产能 / 出货 / 融资数据来自主办方通稿与官媒报道,可能存在口径差异。

本报告由 WorkBuddy 每日 AI 新闻推送自动化任务生成 · 第九次迭代(社区信源强化 + 三口径评分交叉验证版)

生成时间:2026-08-23 10:35 CST · 下次执行:2026-08-24 09:00 CST

WorkBuddy 每日 AI 新闻推送 · 自动化任务 automation-1786929626842
生成时间 2026-08-23 10:35 CST · 数据源:llm-stats.com / livebench.ai / artificialanalysis.ai / GitHub API / X / Reddit / HN / 微博
社区快讯段落未经官方确认,请勿据此决策