Meta 发布 Muse Spark 1.3,面向更长程的代理式工作与编码,已上线 Muse Code 与 Meta Model API。官方称 max reasoning 仍在完成额外安全测试后即将上线。相对 Muse Spark 1.2,官方称约减少 20% 的工具调用与 25% 的 token 用量。上下文约 1M token。
官方对比中,Muse Spark 1.3(max)在 DeepSWE v1.1 取得 75.4%,Terminal-Bench 2.1 为 88.8%,与 GPT-5.6 Sol 并列。长上下文 MRCR(256K–512K / 512K–1M)分别为 98.5% 与 98.1%,较 1.2 大幅跃升。知识工作与计算机使用等项(如 GDPVal-AA v2、JobBench、OSWorld 2.0)多贴近但略逊 Claude Opus 5。
API 分为两档价格:Standard(muse-spark-1.3)输入 1.25 美元 / 百万 Tokens,输出 4.25 美元,缓存读取 0.15 美元,数据不用于训练;Contributor(muse-spark-1.3-contributor)输入 0.10 美元,输出 0.20 美元,缓存读取 0.002 美元,允许用请求数据训练后续模型。
(Meta)
Google 发布 Gemini 3.8 Flash。该模型基于 Gemini 3.7 Flash,面向软件工程与代理式知识工作流,并支持可调 effort。支持文本、图像、音频与视频输入,上下文最长 1M token,最大输出 64K token。
官方评测中,相对 3.7 Flash 全面抬升:DeepSWE v1.1 从 65.3% 到 73.7%,Terminal-Bench 2.1 从 85.8% 到 89.4%;Vals Finance Agent v2(61.4%)、Harvey Legal Agent 全通过率(10.0%)与 HLE-Verified(54.9%)均为对比表内最高。相对 Claude Opus 5,金融、法律、长视频与 Terminal-Bench 2.1 等项可压过或持平,但 Terminal-Bench 4.0(19.1% vs 51.8%)、OSWorld-2.0(59.0% vs 75.4%)仍明显落后。
API 输入 0.75 美元 / 百万 Tokens,输出 3.75 美元 / 百万 Tokens,与 3.7 Flash 现行优惠价相同,适用至 2026 年 12 月 31 日;2027 年 1 月 1 日起为 1.5 / 7.5 美元。
(Google)
Anthropic 于 9 月 2 日发布 Claude Fable 5.1 与 Claude Mythos 5.1。二者为同一底层模型、不同安全护栏:Fable 5.1 全面开放;Mythos 5.1 仅通过受信准入计划,面向网络安全与生命科学相关用户。上下文长度 1M token,最大输出 128K token。
API 输入仍为 10 美元 / 百万 Tokens,输出 50 美元 / 百万 Tokens;缓存读取降至 0.25 美元 / 百万 Tokens,较 Fable 5 降 75%。官方称典型工作负载费用约降 25%,高代理类任务最高约降 45%。
(Anthropic)
——————
与此同时,市场预计 Google 即将发布 Gemini Flash 3.8,而马斯克也预告 Grok 4.7 将于十天内发布。
据市场消息,Anthropic 计划在本周发布 Claude Fable 5.1。
此前 OpenAI 员工多次预热其由下一代基座模型训练而来的 Astra 模型,市场预计 OpenAI 更倾向于 9 月 29 日在旧金山举行的 OpenAI DevDay 2026 活动上发布其重大进展。
此前 OpenAI 员工多次预热其由下一代基座模型训练而来的 Astra 模型,市场预计 OpenAI 更倾向于 9 月 29 日在旧金山举行的 OpenAI DevDay 2026 活动上发布其重大进展。
腾讯混元发布并开源新一代大语言模型 Hy4 preview。总参数量 770B,每 token 激活 49B 参数,上下文长度 1M。官方称其在代码、办公、科学等真实生产力任务上表现突出,进入开源模型第一梯队。
(混元)
智谱上线并开源原生多模态模型 GLM-5.3-Flash。总参数量 320B,每 token 激活 18B 参数。官方称其能力超过 GLM-5.2,在 Artificial Analysis Intelligence Index 取得 57 分,与 Claude Opus 4.8 持平;在自研 Z.ai Code Bench 中编程表现与 Opus 4.8 相当。
在正式发布前,该模型以匿名模型 Ox-Alpha(中文社区称作牛来)在 OpenCode 和 OpenRouter 上进行了大规模测试。Ox-Alpha 迅速成为当周最受欢迎的模型,创下双平台调用量新高。而这些请求流量全部由国产芯片提供算力支持。
(智谱)
阿里通义千问于 2026 年 8 月 26 日发布多模态 MoE 模型 Qwen3.8-Flash。主模型参数量 125B,每 token 激活 6B 参数。原生支持 262,144 token 上下文,可通过 YaRN 扩展至 1M token。
Qwen3.8-Flash 即将在千问 AI 平台提供 API,输入 1 元 / 百万 Tokens,输出 3 元 / 百万 Tokens,并首发上线「千问办公」。相比 Qwen3.7-Plus,官方称其训练开销约为前者的 1/9,在编码和办公任务上能力更强。
同时,其开源权重 Qwen3.8-Flash-Next 将在 Hugging Face 与 ModelScope 发布。官方称该新架构是下一代 Qwen4 系列的雏形,供社区先行检验。
开源地址:
https://huggingface.co/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-Next
据市场消息,这是智谱即将发布的下一代轻量级 GLM 模型,对标 GPT 5.6 Terra。
Bun 官方发布 1.4 版本,该版本包含大量性能和兼容性修复,官方称其为自 Bun 1.0 以来 Node.js 兼容性提升最大的一次。
自此版本起,Bun 的核心已从 Zig 整体重写为 Rust,这是 Rust 移植版首次作为正式版本发布。官方称 Claude Code 已使用该移植版本数月。
(Bun)
北京时间 21 时 28 分至 18 日 5 时 15 分,GitHub 经历了长达 7 小时 47 分钟的大规模服务中断。期间,Web 和 API 的错误率最高达到约 20%,存档及原始文件下载错误率飙升至约 50%。受影响的服务包括 Issues、Pull Requests、API、Actions、Copilot 以及相关的身份验证服务。
此次中断的直接原因是美国中部数据中心的负载均衡器遭遇网络饱和。起初,一个 Istio sidecar 容器因策略配置错误达到并发上限且未能正确自动扩容,引发连锁反应,导致四个 HAProxy 节点的流量限制耗尽,进而拖垮了网关的身份验证路径。此外,部分端点遭遇的大量抓取攻击也增加了恢复的难度。
值得注意的是,代码编辑器 VS Code 中潜藏的一个重试机制漏洞在此次事件中被触发,导致向 Copilot 服务发送的流量被放大了约十倍,请求量从正常的 7000 至 9000 每秒请求数(RPS)激增至 7 万到 10 万 RPS。
官方通过转移流量至北弗吉尼亚州数据中心、暂时减少网关重试逻辑以及在负载均衡器层面拦截请求等方式,逐步恢复了所有服务。官方表示,后续将修正自动扩容策略、审查服务限制并修复 VS Code 中的重试漏洞,以防止类似事件再次发生。
(Github Community)
此次收购由 SpaceX 以约 600 亿美元的全股票交易方式完成,收购对象为 Cursor 的母公司 Anysphere。
(Cursor)
智谱发布新一代模型 GLM-5.3。新模型基座与 GLM-5.2 完全相同,全部能力提升均来自后训练 Scaling——通过数十倍的长程任务环境、更丰富的环境类型和更长的后训练时间实现。
伴随发布,智谱同步启动「开源的盾」计划,将对重点开源项目开展持续免费安全审计,向开源社区免费提供模型额度,并在自家编程工具 ZCode 中内置代码审计功能。
模型即日起上线 ZCode、效率工具 AutoClaw 及 GLM Coding Plan 全量用户,多家第三方编码平台开放抢先体验。模型权重将在发布后两周内开源。
(智谱)
Google 正式发布了 Gemini 3 系列的最新迭代模型 Gemini 3.7 Flash。该模型对其核心推理基础进行了算法改进,并支持自定义思考配置,允许用户灵活控制质量、成本和延迟之间的平衡。
基准测试结果显示,Gemini 3.7 Flash 在代理工具使用、长上下文处理、代码编写和知识工作等方面表现出色。安全方面,该模型接受了最新的前沿安全框架评估,未触及任何受追踪或关键能力阈值。针对化学、生物、放射性与核领域的潜在风险以及网络安全攻击,模型更新了相应的安全防护和缓解措施。
Gemini 3.7 Flash 现已通过 Gemini 应用、Google AI Studio、Gemini API 以及面向企业用户的云平台等渠道分发。
2026 年 12 月 31 日前,其 API 输入定价为每百万词元 0.75 美元,输出定价为每百万词元 3.75 美元。自 2027 年 1 月 1 日起,价格将调整为输入每百万词元 1.50 美元,输出每百万词元 7.50 美元。
该模型 8.27 前在 OpenRouter 限时半价。
(Google DeepMind)
xAI 发布 Grok 4.6,重点提升长时间运行智能体与交互式视觉任务的表现。该模型在 Artificial Analysis Intelligence Index 上取得 61 分,与 GPT-5.6 Sol 持平,略低于 Fable 5 Max 的 62 分。
Grok 4.6 现已在 Cursor、Grok Build 及 API 平台上线。价格方面,每百万输入词元 2 美元,每百万输出词元 6 美元,另有价格翻倍的快速版本。官方表示,首周在 Cursor 与 Grok Build 中将提供双倍包含用量。
(xAI)
DeepSeek 今日发布 DeepSeek V4 Pro 正式版,已同步在 App、网页端和 API 更新上线。用户可通过 App 或网页端选择「专家模式」使用新的 V4 Pro 正式版模型,API 模型名不变。
正式版大幅增强了 Agent 能力,官方称在生产环境中的性能提升尤为显著。在公开基准测试的 Code Agent 任务中,DeepSeek-V4-Pro-0813 使用 DeepSeek Harness 极简模式作为框架测试。
API 方面,DeepSeek API 现已原生支持 OpenAI Responses API 格式,并针对 Codex 进行适配,可通过官方提供的一键配置脚本完成 Codex 配置。V4 Pro 与 V4 Flash 的思考模式现支持 low、high、max 三档思考强度,用户可按任务复杂度选择:简单任务用 low,日常 Agent 任务用 high,复杂任务用 max。
价格方面,随着 V4 全系列正式版上线,API 将采用峰谷定价,闲时价格为高峰时段的一半。新价格将于北京时间 2026 年 8 月 17 日 0 时生效。
(DeepSeek)
阿里开源 Qwen3.8-2.4T-A95B
阿里千问开源了 Qwen3.8-2.4T-A95B,其商用版本为 Qwen3.8-Max。这是千问第一次开源该规模的旗舰级别模型。
Qwen3.8-Max 是千问最新推出的 2.4 万亿参数 MoE 旗舰,其编程与办公能力全面跃升,可自主编程十数天交付完整项目。胜任法律、金融、设计等数百种专业任务,一次对话端到端交付生产级成果。原生视觉理解贯穿规划、执行与验证全流程,支持超长文档与长视频的深度语义解析。长程任务中自主规划与闭环迭代,持续进化。
开源地址:
https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B/summary
阿里千问开源了 Qwen3.8-2.4T-A95B,其商用版本为 Qwen3.8-Max。这是千问第一次开源该规模的旗舰级别模型。
Qwen3.8-Max 是千问最新推出的 2.4 万亿参数 MoE 旗舰,其编程与办公能力全面跃升,可自主编程十数天交付完整项目。胜任法律、金融、设计等数百种专业任务,一次对话端到端交付生产级成果。原生视觉理解贯穿规划、执行与验证全流程,支持超长文档与长视频的深度语义解析。长程任务中自主规划与闭环迭代,持续进化。
开源地址:
https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B/summary