起于小站,终于生活。
现实之外,一个普通人的思考。

博客地址:ygxz.in
讨论组:https://t.me/ygxz_group
LLaDA Image 发布 60 亿参数开源图像生成模型

LLaDA 团队于 9 月 4 日正式开源 LLaDA-Image,推出 60 亿参数(6B) 图像生成模型家族,并同步发布 Base 与 Turbo 两个版本,以及模型权重和推理代码。团队表示,LLaDA-Image 是一个统一的图像生成与编辑模型,无需额外编辑模型即可同时完成文生图和指令式图像编辑任务。

官方介绍,LLaDA-Image 包含两个版本:LLaDA-Image Base 采用 50 步采样,面向高质量图像生成与编辑;LLaDA-Image-Turbo 则通过 Twin-DMD 蒸馏 技术,将采样步数压缩至 4 步,实现更快的推理速度。两者均支持文生图、参考图编辑、VQ 条件生成以及中英文文字渲染。

能力方面,LLaDA-Image 采用统一扩散(Unified Diffusion)框架,将生成模型与编辑模型融合到同一套架构中,可生成具有自然光照、丰富细节和一致场景的高质量图像,同时支持基于自然语言指令的图像编辑,在保留原图主体内容的基础上完成精确修改。

训练方面,团队提出了一套新的训练流程:先通过纯图像预训练(Image-only Pre-training) 学习视觉先验,再引入图文配对数据进行监督训练,最后联合优化图像生成与编辑任务。官方认为,这种训练方式能够提升模型的视觉理解能力,并增强生成质量。

在评测中,官方表示 LLaDA-Image 在 Qwen-Image-Bench 上取得 英文 53.53、中文 53.38 的综合成绩,达到当前公开模型中的领先水平(SOTA)。
开源计划方面,目前团队已开放 模型权重 和 基于 Diffusers 的推理代码,并表示训练代码将在后续发布,进一步完善完整开源生态。

值得注意的是,目前 LLaDA 系列已由蚂蚁集团旗下 Inclusion AI 团队维护。GitHub 官方组织页面显示,Inclusion AI 是蚂蚁集团面向 AGI 研究设立的开源组织,负责持续推进 LLaDA 系列扩散语言模型及多模态模型的发展。

Github)
OpenAI 发布 GPT-6 Astra

OpenAI 于 9 月 3 日发布 GPT-6 Astra,公司称其为「代际跃升」,并表示未来可能被视为通用人工智能(AGI)到来。

官方称 Astra 基于迄今最大规模训练,在得克萨斯州 Stargate 使用逾 10 万块 GPU,并首次让其他模型在监督其训练中扮演重要角色。

模型将先面向 Daybreak Access 计划内有限机构开放,并称「未来几天」面向 ChatGPT Plus、Pro、Business、Enterprise 与 API(gpt-6-astra),并上线 AWS Bedrock 与 Microsoft Azure。

价格方面,API Standard 输入 10 美元 / 百万 Tokens,输出 50 美元;Fast 模式最高约 2.5 倍速度,价格为 Standard 的 2 倍。

OpenAI 此前已将其定为 Preparedness Framework 下首个达到「Critical」网络安全能力阈值的模型。

即日起至模型广泛可用前,OpenAI 将为所有付费用户每天提供一次重置限额的机会。


(综合媒体报道)
一个小站的自留地
据市场消息,OpenAI 计划提前其 Astra 模型到今日(9 月 3 日)发布。 一天前,OpenAI 宣布 Astra 在网络安全能力上实现了重大飞跃,已经触碰到了「严重」(Critical)风险阈值。
据 DownDetector,目前 OpenAI、Claude、Grok 均出现大规模宕机。

其中Grok和Claude的宕机源于SpaceX的Memphis compute center基础设施故障。

今年五月,Anthropic官宣租用了SpaceX(也就是Grok母公司)位于Memphis的SpaceX's Colossus 1算力中心。
一个小站的自留地
Astra 模型
据市场消息,OpenAI 计划提前其 Astra 模型到今日(9 月 3 日)发布。

一天前,OpenAI 宣布 Astra 在网络安全能力上实现了重大飞跃,已经触碰到了「严重」(Critical)风险阈值。
Meta 发布 Muse Spark 1.3

Meta 发布 Muse Spark 1.3,面向更长程的代理式工作与编码,已上线 Muse Code 与 Meta Model API。官方称 max reasoning 仍在完成额外安全测试后即将上线。相对 Muse Spark 1.2,官方称约减少 20% 的工具调用与 25% 的 token 用量。上下文约 1M token。

官方对比中,Muse Spark 1.3(max)在 DeepSWE v1.1 取得 75.4%,Terminal-Bench 2.1 为 88.8%,与 GPT-5.6 Sol 并列。长上下文 MRCR(256K–512K / 512K–1M)分别为 98.5% 与 98.1%,较 1.2 大幅跃升。知识工作与计算机使用等项(如 GDPVal-AA v2、JobBench、OSWorld 2.0)多贴近但略逊 Claude Opus 5。

API 分为两档价格:Standard(muse-spark-1.3)输入 1.25 美元 / 百万 Tokens,输出 4.25 美元,缓存读取 0.15 美元,数据不用于训练;Contributor(muse-spark-1.3-contributor)输入 0.10 美元,输出 0.20 美元,缓存读取 0.002 美元,允许用请求数据训练后续模型。

Meta
Back to Top