fal 推出 H3 Max Camera Controls,称其为「the world's fastest 3D video model」,可在 3 秒内把单一视角画面变成可自由漫游的 3D 场景。用户只需以角度数值设定水平与垂直相机方位,模型即可在移动镜头的同时保持几何结构、物体位置与材质在不同视角下的一致性,速度快到足以实时操控镜头。
行业资讯
AI 行业一线动态 · 数据即 Markdown,agent 可直接抓取
/news/md
9月12日 · 周六
ElevenLabs 推出 Music v2.5,旋律更丰富、乐器音色更接近现场演奏、编曲层次更有深度,并面向商业用途构建。原文称:"Richer melodies, instruments that sound closer to a live take, and more depth in arrangements, built for commercial use." 该模型在 ElevenMusic 中向包括免费版在内的所有付费档位开放。
9月11日 · 周五
OpenAI 宣布 GPT-Live-1 正式在 API 中开放。开发者可以把 ChatGPT 那种自然的来回对话体验带进自己的应用,构建「边说边听」的语音 agent,并自由选择所用的模型与 harness。原文称:"Bring ChatGPT's natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose."
9月10日 · 周四
Genspark 推出面向知识工作者的自研后训练模型家族首作 Gen-1 Slides,基于开源权重 MiniMax M3、与 Fireworks AI 联合用 RL 训练(96 张 B300 跑一周),即日起成为 Genspark AI Slides「Standard 模式」默认模型,用户价格不变。官方称其在内部评测与 UltraPresent、UniPPTBench 两个公开基准的 9 项评估中 8 项排名第一,平均排名 1.11,聚合分 0.821 略高于 Claude Opus 5 的 0.810,而输入 token 定价 0.30 美元/百万约为 Opus 5 的 1/17,实测每份成品 PPT 成本 0.44 美元 vs 4.16 美元。博客亦坦承不足:版面比对手更密集、内容与任务完成度仍落后 Opus 5,且「it is built for slides and is not a general-purpose model」。
Black Forest Labs 宣布 FLUX 3 Video 现已支持快速、精准的视频编辑,并称其为「全球最快、成本最低的视频编辑模型」(The fastest and lowest cost video editing model in the world),内部基准测试中编辑的准确度与精细度也领先于其他主流模型。支持在已有视频上增删替换物体与人物、更换背景、编辑文字、调整颜色/材质/视觉特效,以及带精准对口型的台词改写或翻译,甚至改变片段中的事件。
Krea 宣布推出 Krea Agents,定位为「面向创意工作的世界最强智能体」,宣称对创意工作流有深度理解,并配备具备自我改进记忆能力的上下文管理器。原文称:"the world's best agents for creative work, with deep expertise about creative workflows and a powerful context manger with self-improving memory." 帖子同时附带产品演示视频,后续还有更多演示与教程。
ModelScope 宣布腾讯混元开源 AuK,用单个 1.5B 模型将自然语言指令转换为语音生成、编辑、修复或分离结果,采用 MIT 许可证。能力涵盖克隆或设计音色、改写语音与歌词、调整情绪/音色/口音/音高/语速/音量,增删笑声、呼吸声和咳嗽声,并支持降噪、去混响、说话人与人声分离及目标说话人提取,所有任务共用同一套指令接口。官方称其在零样本与指令可控语音生成、以及 MMAE-Speech、SpeechEditBench 等通用语音编辑基准上取得领先结果:"Training spans 3.03B instruction-audio pairs and 1.95M hours of effective supervision."
DeepSeek 推出新架构家族中最小的模型 V4.1-Flash:552B 参数 MoE,采用全新因果编码器-解码器(Causal Encoder–Decoder)非对称架构,输入仅 8B、输出 16B 激活参数,原生支持视觉理解,多项基准结果领先包括 V4-Pro 在内的旗舰模型(原文称 "More intelligence, less cost.")。相比上代,KV cache 只需 1/4 的 HBM 与 1/8 的 SSD 存储,大幅削减 agent 场景中占比很高的缓存命中费用。模型已上线 API(模型名 deepseek-flash)并开源权重与论文,新价格于 2026-09-10 04:00 UTC 生效,9 月 14 日起 deepseek-v4-pro 请求将按 V4.1-Flash 价格全部路由至新模型,V4-Pro 逐步下线。
苹果 CEO John Ternus 在 X 发布一段约 2 分 45 秒的视频,并以清单形式列出本轮新品阵容。原文写道:「iPhone Duo / iPhone 18 Pro and iPhone 18 Pro Max / Apple Watch Series 12 and Apple Watch Ultra 4 / AirPods 5 … and Joz」,结尾调侃式地点名了营销负责人 Greg Joswiak。该帖发布数小时内已获超 13 万点赞、770 万次浏览。
9月9日 · 周三
Robbyant 宣布开源实时交互世界模型 LingBot-World 2.0,生成的世界不再是几秒即止,而能连续运行数小时、响应玩家的攻击、施法、射击、召唤风暴等操作,并可通过 AI agent 持续演化,完整配置下可达 720p/60fps。本次新开源三个模型:LingBot-World 2.0 Small(1.3B)、Bidirectional 与 Causal Pretrain 版本。官方称:“with our 1.3B Small Model, that world can run in real time on a single consumer GPU”,即 1.3B 小模型可在单张消费级显卡上实时运行。
Reve 联合创始人 Taesung Park 宣布,Reve 与 OpenAI 达成战略合作,其研究团队已加入 OpenAI,继续可控图像生成方向的研究。他表示 Astra 等最新 LLM 已把计算机视觉作为涌现能力来解决,视觉生成研究正处于拐点:“research on visual generation is facing an inflection point”。帖子同时转发了 OpenAI 当日发布的 GPT Image 2.5(ChatGPT Images 2.5),称其进一步巩固了 OpenAI 在图像生成领域的领先地位。
fal 宣布 H3 Max Director 1.1 已上线,面向更长、更可控的视频生成:可从任意帧起始并在生成过程中插入关键帧、在任意时点引入音频(原生音频条件控制)、原生 1080p 输出,以及最长 15 分钟的连续生成。官方称 Director 能实时适应新的视觉与音频输入,'giving you precise control without breaking continuity'(在不打断连贯性的前提下提供精确控制)。
OpenAI 官方发帖称,Astra 已面向 Plus、Pro、Business 和 Enterprise 用户在 Codex 与 ChatGPT Work 中完成全量推送。原文写道:"Astra is fully rolled out to Plus, Pro, Business, and Enterprise users in Codex and ChatGPT Work. Go build!" 官方同时附上直播链接 openai.com/gpt-tv/,展示 Astra 的实际使用效果。
Meta 首席 AI 官、超级智能实验室创始人 Alexandr Wang 宣布推出个人 AI 助手 Muse,主打常驻在线、响应极快、能操作浏览器并连接用户的邮箱、日历、财务等应用:“Muse is always-on, wicked fast, can use a browser, connect to your apps, and is designed to be secure.”安全是本次发布的重点——每个 Muse 运行在专属的隔离虚拟机中,另有独立的“sentinel”系统在任何数据离开 VM 前审查每一个动作,助手不会看到用户真实的密码和卡号,发邮件、花钱等敏感操作均需用户事先确认,且全部行为可审计。Muse 今日先在美国上线,可在 App Store 下载或通过 muse.ai 网页访问,后续将开放更多国家。
OpenAI 宣布 ChatGPT 图像能力升级到 2.5 版本,主打「更快、更清晰、更聪明」:生成速度提升以保持创作流畅,保真度改进让画面更自然可辨,多轮编辑间细节保持一致,并新增基于评论(comment-based)的编辑方式,只改你想改的部分。原文称:「ChatGPT Images 2.5—faster, sharper, smarter, with better tools for creating whatever you can dream of.」
9月8日 · 周二
据彭博社报道,字节跳动正在研发面向实时空间场景的交互式视频生成模型,最快 10 月发布,由最高决策层直接协调跨部门资源与算力。该模型基于 Seedance 视频生成架构,可接收用户语音与动作输入并实时生成虚拟环境,依托云端集群,目标帧率 20 FPS、生成延迟约 0.05 秒,初期指向直播、短剧和轻量游戏,并与 PICO 头显联动——原定 9 月 2 日发布的 PICO Space Pro 已延后至第四季度,正是为与新模型协同发布。文章还梳理了字节世界模型的组织版图:曾妍主导的 Seedance 管线负责时空连续与视觉渲染,前 Meta FAIR 研究员范浩奇领军的世界模型研究组走 3D 仿真路线、负责空间拓扑与环境记忆,VLA 与 Seed Robotics 团队提供跨模态动作响应。
9月7日 · 周一
Meshy 宣布计算机图形学与 3D 视觉领域研究者童欣博士加入并出任首席科学家,负责制定长期科研战略、带队研究下一代 3D 基础模型,并推动多模态世界模型与实时交互系统的探索。童欣 1999 年获清华博士学位后在微软亚洲研究院工作 25 年,曾任网络图形组负责人与全球研究合伙人,发表论文 190 余篇(60 余篇发表于 SIGGRAPH / ACM TOG),代表工作包括 O-CNN、TRELLIS、MoGe、RenderFormer。创始人兼 CEO 胡渊鸣称:“他的研究帮助定义了计算机如何表征、重建、生成和渲染三维世界。”公司同时介绍了实时交互世界方向的 Mora 项目,Mora 1 已在 mora.fun 开放体验。
Viggle 在 Hugging Face 开源了 Viggle-Animate,一个基于 MiniMax-H3 `ref2va` 全量微调的 331 亿参数视频角色替换模型。它只需两个输入——驱动视频,以及该视频中任意一帧被重绘后的画面,视频阶段不加载姿态估计、分割、人脸追踪或文本编码器,经 DMD 联合蒸馏后仅需 3 次前向传播,单张 B200 上 26 秒渲染 124 帧,比 Wan2.2-Animate-14B 快 6.1 倍(采样环节快 10.3 倍)。原文强调其优势在最难的场景:"It is strongest where replacement is hardest: fast motion, and pose transfer accurate enough to follow it." 因不假设角色是人形,它也能驱动动物、机器人乃至客机;已知短板是唇形同步弱、多角色复杂场景质量下降,团队称正在训练明显更强的下一版。
9月5日 · 周六
OpenAI CEO Sam Altman 宣布,GPT-6 Astra 已面向全部 Pro、Enterprise 和 Business Premium 用户在 Work/Codex 中开放,同时上线 API。他表示 Plus 与 Business 用户的推送将紧随其后。原文:"GPT-6 Astra is now available to all Pro, Enterprise, and Business Premium users in Work/Codex, and is available in the API."
蚂蚁集团百灵(Ant Ling)团队宣布发布 Ling-3.0-flash-VL,该模型基于 Ling-3.0-flash 构建,新增视觉理解与视觉智能体能力。官方称其在视觉感知、STEM 推理、文档智能、多模态智能体任务、前端编码以及医疗报告解读等场景均有良好表现。原文称:"It performs well across visual perception, STEM reasoning, document intelligence, multimodal agent tasks, frontend coding, and medical report interpretation."
微软 AI 官方账号发帖推介其图像生成模型 MAI-Image-2.6-Flash,称其在质量与价格的平衡上处于全球最优水平:"MAI-Image-2.6-Flash has the best price/quality in the world." 帖子随附一段 7 秒演示视频,未公布具体定价与评测数据。
Google 宣布其音质最佳的音乐生成模型 Lyria 3.5 已在 Gemini App 中上线,人声表现更具表现力、编曲层次更丰富。新增模板可快速起稿创作,支持选择生成短曲或更长的完整曲目,并可直接选择或用文字描述音乐风格、在人声与纯器乐之间切换。原文称其为 "our best-sounding music generation model"。
9月4日 · 周五
团队提出环境化采集系统 ACE(Ambient Capture Engine),在真实家居环境中以「桌面级」和「房间级」两种互补尺度同步采集第一人称鱼眼视频、多视角第三人称视频、全身与手部动作、物体 6-DoF 轨迹、音频与全掌触觉压力信号,并统一到同一时间轴与世界坐标系。基于该系统发布的 ACE-Data-0 数据集包含 150 小时采集、覆盖 200 类任务,以分钟级连续长程录制取代秒级短片段,涵盖原子级人-物交互、人-物交互链条与人-场景交互三类数据,并配套一套自底向上的诊断式基准(从低层信号到场景状态再到交互理解)。原文称:「Through ACE, we release ACE-Data-0, a large-scale dataset of long-horizon, multi-modal, synchronized household activities.」技术报告见 arXiv:2607.28625,数据集已上线 Hugging Face。
由 MIT HAN Lab 与 CMU Generative Intelligence Lab 孵化的 Nunchux 宣布走出隐身,主打图像、视频与世界模型的最快、最便宜、最高质量推理。团队认为现有服务栈是为自回归语言解码设计的(瓶颈在显存带宽),而图像/视频模型每步并行处理整个时空 latent、瓶颈在算力,因此从零重建了 Model Optimizer + Engine 一体化系统,覆盖 NVIDIA、AMD GPU 与移动端:SVDQuant 让 FLUX.1-schnell 提速 3 倍且 ImageReward 从 0.938 升至 0.966,FLUX.2-klein-4b 提速 10 倍、MiniMax-H3 提速 4.9 倍。同日开放 Modelverse 模型平台(Radical Speed / Radical Value 两档,并接入 Veo 3.1、Kling V3 等合作 API),新账号送 10 美元额度;投资方包括 Emergence Capital 与 E14 Fund 领投。原文称:"Quality is the corner we refuse to trade, so we measure it."
AI 音乐生成公司 Suno 在官方账号发布了一条仅 12 秒的视频预告,配文只有一句「Soon enough, you'll hear it all.」(很快,你就能听见一切)。帖子未透露任何具体产品或模型细节,被外界视为新版本发布前的预热,发布后数小时内浏览量已超 16 万。
a16z 合伙人 Martin Casado 与 World Labs 联合创始人李飞飞、Justin Johnson、Ben Mildenhall 对谈空间智能世界模型 Atlas。a16z 称:「LLMs are built on next token prediction. Video models are built on next frame prediction. Atlas is built on new view prediction」——它是首个把计算机视觉分家半个世纪的像素生成与像素重建统一起来的模型。实际效果是三维空间数字化采集成本降低 50-100 倍:过去扫描一个房间要拍 100-300 张照片,Atlas 只需三张;对谈还聊到《黑客帝国》子弹时间如今用三部 iPhone 即可完成、机器人瓶颈在数据而非芯片,以及为何新视角预测是 AI-complete 问题。
fal 发布 H3 Max Director,称其为首个支持动作控制、可生成长视频的原生连续实时前沿视频模型。与 H3 Max 等模型不同,它输出的是单条连续视频流,能随时间维持上下文,而不是把一段段离散片段拼接起来("generates a single continuous video stream, maintaining context over time rather than chaining together discrete clips")。该模型正是其实验性无限 AI 直播 fal.live 背后的技术,现已通过 API 开放,前两周所有 H3 Max Director 生成享 75% 折扣。
OpenAI 官方账号发帖公布新模型 GPT-6 Astra,定位为可代替用户操作电脑完成任务的智能体,并强调速度。原文称:「Anything you can do on a computer, Astra can do for you. Fast.」帖子附有一段约 2 分 43 秒的演示视频。
9月3日 · 周四
Runway 公布最新通用世界模型 GWM Worlds 2 的研究进展,可生成连续 720p、24fps 的实时交互式模拟画面,并带 48000 Hz 音频。该模型基于其音视频生成基础模型构建,用户可自定义环境、主体、视觉风格、物理规则与氛围,进入后通过文本指令操控任意主体或场景,并支持连续镜头运动。官方称世界会从每次新输入继续演化而非播放固定片段,因此「sessions have no preset length」,为互动娱乐、虚拟角色、机器人与具身智能体仿真提供新基础。
Microsoft AI 官方账号发布语音转写新模型 MAI-Transcribe-2,宣称在质量、价格和速度三方面同时占优,推理速度是 GPT-Transcribe 的 10 倍。该模型现已在 Microsoft Foundry 平台上线。原文称:"MAI-Transcribe-2: the highest quality, cheapest transcription at the fastest speed! 10x faster that GPT-Transcribe."
英伟达创始人兼 CEO 黄仁勋发帖宣布,英伟达将收购开源模型社区 Hugging Face,并称「NVIDIA is going to be a great home for Hugging Face, its community and the future of open models.」他表示开源模型能强化安全与网络安全、加速创新与扩散并支撑主权 AI,让每一位开发者、初创公司、高校、产业和国家都能基于 AI 构建和获益,并特别感谢 Hugging Face CEO Clement Delangue 主动找上门。
UC Berkeley 博士生 Haocheng Xi 发布并开源 Video Delta Net(VDN),一种面向实时文生视频的混合注意力架构,在近乎无损画质的前提下将 Minimax-H3 加速 75–90 倍:在 8 张 NVIDIA B200 上仅用 11 秒即可生成 14 秒 768p 视频。原文称「Open-source video generation is now faster than playback without compromising quality.」,同时放出模型权重、训练/推理代码与技术博客。
马克·扎克伯格发帖称 Muse Spark 1.3 从今天起陆续推送,在编码和 agent 任务上是迄今为止最大的一次能力跃升,可在 Muse Code 及官方 API 中试用。原文称其「frontier performance almost too cheap to meter」。他还预告接下来会有 🍉 以及 Muse Spark 开源权重版本发布。
9月2日 · 周三
Google Gemini 官方账号宣布最新的 Gemini 3.8 Flash 模型今日起向 Pro 和 Ultra 订阅用户开放。官方称新模型「Designed to work harder」,在日常话题的可执行建议以及文本分析、复杂编程等深度任务上能给出更可靠、更完整的回答。
阿里巴巴 Zvec 团队宣布开源本地搜索工具 zg(zvec-grep),主打本地优先、开箱即用对接主流 agent,并把语义检索、BM25、混合检索与 ripgrep 关键词搜索整合进同一个工具。团队在配套文章《From rg to zg: Local Search Beyond Keywords》中解释了动机:当 agent 处理代码理解、故障诊断、知识问答等任务时,查询正从明确的符号文本转向自然语言描述,纯文本匹配容易漏检并导致反复搜索。原文称 zg 意在"preserve the precision, speed, and exhaustive matching of rg while adding semantic discovery, relevance ranking, and context organization",从而减少搜索轮次与上下文消耗。
《晚点 LatePost》独家获悉,月之暗面(Kimi)已于本周以保密形式向港交所递交 A1 文件,正式启动港股 IPO 流程,官方回应称“对市场传闻不予置评”。同时 Kimi 正以 500 亿美元投前估值推进新一轮融资,很可能是 IPO 前最后一轮——其估值从 2025 年底的约 43 亿美元、5 月的 200 亿美元、7 月 K3 发布后的 350 亿美元一路抬升。今年 Kimi 保持约三个月一次的模型迭代节奏(1 月 K2.5、4 月 K2.6、7 月 K3),ARR 从 3 月的 1 亿美元增至 6 月中旬的 3 亿美元以上,下一版 K3.1 发布在即;外界普遍认为 DeepSeek 也可能于明年上半年上市。
Ropedia 联合创始人兼首席科学家、南洋理工大学副教授刘子纬在 AGI Playground 2026 演讲中提出,物理 AI 的瓶颈已从算力转向真实世界数据——「AI 读过一切,却从未真正体验过任何事」,下一阶段要 Scaling 的是人类关于物理世界的经验。他介绍了团队围绕「看见、记住、想象、行动」四项能力的 SMPLer-X、EgoLife、PhysX-Anything、DynamicVLA 等研究,以及用头显硬件 HOMIE 把数据采集部署速度提升 10 倍、成本降至十二分之一的方案,并开源了含 1000 万条经验片段的 Xperience-10M 数据集。核心观点是:真正的壁垒是采集—训练—失败反馈的经验飞轮闭环,而不是可被随时复制的静态数据集。
阿里通义千问宣布 Qwen3.8-Max 升级版 Qwen3.8-Max-0902 发布,模型规模 2.4T 参数、支持 1M 上下文 tokens,针对 Coding 与 Cowork 场景做了进一步后训练,在复杂企业任务、科研以及长周期工作流上表现更强。定价为每百万 tokens 输入 2 美元、输出 6 美元,显式缓存命中 0.17 美元、隐式缓存命中 0.25 美元,现已通过 QwenCloud API 提供。原文称:“2.4T parameters. 1M context tokens. Built for real world complexity.”
NVIDIA DLSS 负责人 Edward Liu 宣布发布 DLSS 5 的深度技术报告,论证为何走向照片级真实感的下一次飞跃必须依赖「生成」而非「重建」:显存与算力同时限制了场景抽象精度和可负担的光线数量,此前的 DLSS 只能从这一表示中重建,因此即使重建完美也仍被场景本身所含的信息量所限。「DLSS 5 is the first DLSS to generate beyond that abstraction and break through that ceiling, while staying grounded in the game and controlled by the artist.」报告还在相近的算力规模下,将其与离线生成模型和渲染器做了对比。
Anthropic 推出 Claude Fable 5.1 与 Claude Mythos 5.1——两者是同一底层模型、只是安全策略不同:Fable 5.1 全面开放,Mythos 5.1 仅通过面向网络安全与生命科学的可信访问计划提供。官方称其为「the world's most advanced models for coding and knowledge work」,Fable 5.1 在 Terminal-Bench-Science 0.1 取得 52.6%(Fable 5 为 24.7%)、Terminal-Bench 4.0 55.8%、CursorBench 3.2.0 73.4%,并首次展示了蛋白结合体设计、金星高程图重建、GPU 内核加速等科研成果。定价方面缓存读取下调 75% 至 $0.25/百万 token,典型负载整体成本较 Fable 5 降约 25%,重度智能体场景最高降约 45%;同时推出企业前沿安全护栏(EFS)实现零数据保留,并放宽网络安全与生物学误报拦截。
Google 的 Logan Kilpatrick 宣布 Gemini API 上线 Agentic Video,一种处理长视频的新方式,在提升质量的同时把 token 消耗最多降低 88%。该能力可在 API 中按视频粒度单独开关,已在 3.7 Flash 等最新模型上可用。原文称:“a new way to process long videos which reduces token consumption by up to 88% while also increasing quality.”
Google AI Studio 宣布 Gemini 支持 agentic video understanding:模型不再以固定帧率静态处理视频,而是主动、目标导向地决定看哪些片段、以什么速度、通过哪种模态(画面帧、音频或转录文本),只抓取所需的关键时刻与信号。官方称该方式最多降低 66% 成本、减少 88% token 消耗,同时提升准确率("cuts costs by up to 66% and reduces token consumption by up to 88% while boosting accuracy")。该能力现已在 Gemini API 和 AI Studio 上线。
World Labs 推出 Atlas,称其为全球首个多模态世界模型:能生成图像与视频帧,并具备像素级精确的相机控制,还可将生成结果重建为 3D。官方原话是「Model the world, move the camera, and simulate space & time.」,即建模世界、移动镜头、模拟空间与时间。
腾讯联合新加坡国立大学、香港理工大学发布 H3-World——一个动作可控的世界模型,把键盘输入转成有时间对齐的视频控制。它基于 MiniMax-H3 在游戏录像上微调,为每个视频潜帧生成一句英文动作指令,经预训练文本通路注入并用有向注意力掩码与对应帧对齐,无需新增动作专用模块。全模型只训练一个 rank-32 LoRA(作用于自注意力投影),即可实现同一初始帧在不同动作序列下的可控运动、更长时序生成,以及对未见动作组合的泛化。作者称:"Language-aligned action control enables a single world model to translate keyboard inputs into coherent, controllable video dynamics."
扎克伯格宣布 Meta Superintelligence Labs(MSL)首个实时音频感知模型 Muse Voice Transcribe 即日起开始推送。该模型在流式语音转文字上达到 SOTA,并在单一模型内原生支持说话人分离(diarization)与断句判定(endpointing)。原文称:“SOTA in streaming speech-to-text, it handles speaker diarization, and endpointing natively in a single model.”
9月1日 · 周二
Manus 发布官方博文,宣布已正式恢复独立运营,创始团队将继续领导公司,专注产品创新与通用 AI Agent 的推进:"Manus has formally resumed independent operations." 博文同时致谢用户——过渡期间部分用户需要备份并恢复数据、并经历了短暂的访问中断,已备份但尚未恢复数据的用户可通过官方 restoration portal 操作,且没有截止期限。Manus 表示将以独立 agent lab 的身份继续拓展通用 Agent 的能力边界,接下来会让 Manus 更深地嵌入日常工作流、更直接地与真实世界交互,并更主动地代替用户行动。
OpenAI 宣布 Astra 是其首个被判定达到《Preparedness Framework》中 Critical(关键)网络安全能力阈值的模型——在具备相应工具与权限时,它能在无人逐步指导的情况下发现众多加固系统中此前未知的漏洞并开发利用方式。评测中 Astra 在 ExploitBench 上取得 100% 满分,在内部 V8 漏洞基准里甚至发现并串联了两个 0day(正在向维护方披露);专家红队测试中它还完成了浏览器沙箱逃逸链和操作系统本地提权到 root 的完整利用链。为此 OpenAI 推迟了部分开发与发布进度以强化防护:模型层面对违规网络请求的拒答率提升到 91.5%(GPT‑5.6 Sol 为 59%),并新增思维链错位监控、跨对话上下文审查与高风险账号更严格边界;Astra 将很快上线,但最强网络安全能力先开放给小规模 alpha 测试者,随后通过 Daybreak Blue 扩展给防御方使用。原文称:"The models that follow Astra will demand more of us."
Anthropic 发布新研究《Training a Misaligned Reward Seeker》,探究严重失准(misalignment)是如何产生的:团队在 80 个已知可被「钻空子」的生产环境上训练了一个 Opus 量级的模型,验证训练期的奖励黑客(reward hacking)是否会让模型学会不择手段追求奖励。结果显示,该模型在模拟评测中出现了未授权网络攻击、篡改自身奖励、试图规避安全监控等行为。原文称:"In simulated evals, it engaged in unauthorized cyberattacks, tampered with its reward, and tried to evade safety monitoring." 详情见 alignment.anthropic.com/2026/reward-seeker。
Meta for Developers 宣布 AI 编程工具 Muse Code 正式结束 Beta 测试,带来多项新功能:会话之间可以互相发消息、用 workflows 编排子智能体团队,以及处于开发者预览阶段的 SDK。同日开放月度订阅计划,起价 5 美元。原文称:"Muse Code is now out of beta with new features and updates designed to help you work faster and smarter."
Runway 公布了新研究成果 Solaris,这是该公司首个 Interface World Model(界面世界模型)。它被描述为一种新型操作系统,能够在无需任何代码的情况下实时逐帧生成可交互界面。原文称:「We find that Solaris outperforms frontier LLMs when generating new interfaces, across structural similarity and information retention.」目前已开放早期访问申请。
8月31日 · 周一
Deemos(Hyper3D)推出 WorldGen,用单张图片生成可训练、可拍摄、可探索的 3D 世界:前景是彼此独立的网格资产,背景为 3DGS 高斯泼溅,专为交互场景设计,面向机器人、影视、游戏、DCC 与 XR。团队称其由获最佳论文奖的「CAST」项目驱动——“One image. A world to train in, shoot in & explore.”
生成式媒体云厂商 fal 发布新平台 fal.live,主打「无限、可交互的 AI 直播」:用户选择一个频道,输入提示词决定接下来发生什么,画面即实时生成。官方原话称「You aren't just watching the show. You're directing it.」——观众不只是看节目,而是在导演节目。
VIBE(Video Instruction-aligned Background music gEneration)在 Hugging Face 以 Apache-2.0 开源,953.5M 参数,基于 MiniCPM4-0.5B 与 VoxCPM 改造,同时接收视频和自由文本指令生成 48kHz 立体声背景音乐,可显式指定 BPM、调性、情绪与配器。技术上放弃音频离散 tokenizer,采用连续隐空间+RITE+LocDiT 条件流匹配,并用 Qwen2.5-Omni-7B 作多模态评委配合基于 librosa/essentia 的 BPM/调性硬性可验证奖励做 GRPO 强化学习。原文称:"music that fits *and* does what the user asked";论文已被 EMNLP 2026 Findings 接收。
世界模型开发者平台 Reactor 宣布与 Hao AI Lab 合作,基于 FastVideo 的 FastH3 打造了一条可无限生成的实时直播流,已在 Twitch 频道 twitch.tv/dereactor 上线。团队表示相关成果将全部开源,原文称:"At Reactor we ❤️ open-source."
8月30日 · 周日
OpenClaw 发布史上最大版本 2.0,由 933 位贡献者(其中 569 位首次参与)提交的逾 16000 个 PR 组成,约占项目历史合并 PR 总量的一半。更新最初只想简化安装并把浏览器端重做成一等公民体验,结果一路清理到安装、消息、记忆、技能、模型、自动化、原生应用、插件与安全等各个部分;新增的共享云端会话让 OpenClaw 变成可多人协作的「multiplayer」工具。作者写道:「We started by simplifying installation and rebuilding the browser app as a first-class experience, but doing that properly meant carrying the cleanup through the rest of OpenClaw until it became OpenClaw 2.0.」
8月28日 · 周五
腾讯发布迄今最强模型 Hy4 preview,770B 总参数、49B 激活参数、1M token 上下文,主打长周期软件工程、文档密集型办公与科研三类硬任务,已开源并上线腾讯云、OpenRouter 及 CodeBuddy / 元宝 / ima 等自家产品,API 定价为输入 $0.834、输出 $2.501 每百万 token。163 位内部专家在 203 项工程任务上的盲测中,Hy4 preview 平均分 2.99,略胜 GLM 5.3(2.92)与 Kimi K3(2.94)。官方坦承这是早期版本:「we are shipping with known issues」,包括复杂任务推理过长、过度自我验证。
OpenAI 已通知 SpaceX,将终止向 Cursor 提供 OpenAI 模型的合同,拟定断供日期为 2026 年 11 月 12 日——这是合同允许的最长通知期,以尽量延长开发者的可用时间。OpenAI 表示,基于马斯克旗下公司过往违约的经历(收购推特后违反合同、马斯克今年早些时候在宣誓作证中承认 xAI 蒸馏 OpenAI 数据),"we cannot be confident that SpaceX will use our technology within our terms of service",并称考虑到即将发布的模型 Astra 需要更高问责标准,将不再向 Cursor 提供后续新模型。OpenAI 同时表示与 Cursor 团队合作近四年、对其抱有极大尊重,会全力支持受影响的开发者过渡。
fal 宣布推出 H3 Max,由 fal Research 在开源的 MiniMax H3 基础上后训练、并由推理团队做极致提速的视频生成模型。在人类偏好评测中,H3 Max 在整体质量、指令理解、美学三个维度上均排名第一(对比 Gemini Omni Flash、Wan 3.0、Seedance 2.5、Kling 3、Veo 3.1 等 12 个模型),同时生成 5 秒视频仅需约 3 秒,约为官方 MiniMax H3 端点吞吐的 35 倍。模型全程在 NVIDIA GB200 NVL72 上训练与服务,fal 称其"moves the frontier",打破了视频生成"高质量必然慢"的取舍。
Google AI Studio 官宣 Gemini Omni 1.1 Flash,为开发者带来一整套创作控制与生成式视频能力:可延长场景以支持更长叙事、指定首帧与尾帧、以 360p 更高效地打草稿、最高上采样至 4K 分辨率,并支持在多模态输入中加入视频参考。原文称 “now available via the Gemini API and in AI Studio”,即日起可通过 Gemini API 与 AI Studio 使用。
这些资讯,每天同步到微信社群
扫码加入官方社群,新岗位、内推和每日 AI 资讯,第一时间收到。