每日AI快讯热闻

首页推荐8小时前更新 老高
4,774 0
每日AI快讯

AI工具箱聚合全球人工智能领域的最新资讯、行业要闻、融资进展、产品迭代、技术突破与独家爆料,全天候实时更新,帮助你第一时间掌握行业趋势与关键变化。
加入AI交流群,获取权威信息源,抢占AI时代先机!

10月7日 周三

B站开源多语言翻译模型家族 Index-Translate

B站 Index LLM 团队正式开源多语言翻译模型家族 Index-Translate,2B、9B 与 35B-A3B 三档文本模型权重已在 Hugging Face 与 ModelScope 开放。该家族基于 Qwen3.5 构建,覆盖 150 种语言,支持术语、格式与保留内容翻译指令,并延伸出字幕与配音生成、按目标音节数调整译文、长文档上下文一致翻译等能力。

来源:IT之家

谷歌开源多模态嵌入模型 EmbeddingGemma 2

谷歌发布 EmbeddingGemma 2,开源多模态嵌入模型,基于 Gemma 4 架构、740M 参数,把文本、代码、图像、视频、音频映射到同一 768 维向量空间。代码检索在 MTEB Code 上从 68.76 升至 78.68,纯文本仅 270M 参数,端侧量化后约占 191MB 内存,配套 macOS 应用 AI Edge Foresight 可离线整理会议纪要。

来源:IT之家
10月6日 周二

OpenAI 将在欧盟为 ChatGPT 与 Codex 文本输出加入隐形水印

OpenAI 宣布按《欧盟人工智能法案》透明要求,未来几周将在欧盟为 ChatGPT 与 Codex 文本输出加隐形水印。技术名为 textGrain,在模型选词时埋入不可见统计信号,文本复制粘贴后水印随行。测试显示,替换 10% 的词后检测率从约 92% 降至 66%;API 客户可自主开启。

来源:TechCrunch

智谱 GLM-5.3 上架亚马逊 Bedrock,按调用量与 AWS 分成

智谱 GLM-5.3 接入亚马逊云科技大模型平台 Amazon Bedrock,AWS 按模型调用量与智谱进行收入分成。智谱近期还与多家海外云厂商落地同类模式;国内已与阿里云百炼签署分成协议,华为云也已上架 GLM-5.3。财报显示,智谱 2026 上半年营收 9.54 亿元,同比增长 399.7%。

来源:IT之家

英伟达投资的 Reflection AI 发布首款开放权重模型 Beam,5010 亿参数对标 GLM-5.2

英伟达投资的 Reflection AI 发布首款开放权重模型 Beam,总参数 5010 亿,每项任务仅激活 230 亿。官方称其在代码与智能体任务上可对标智谱 GLM-5.2(总参约 7440 亿、激活 400 亿),并逐步逼近千问 3.8-Max。模型权重计划本月稍后开放。

来源:AI工具箱

OpenAI 28 天计划首日:GPT-6 Astra 与 GPT-6.1 Sol 默认推理速度提升约 50%

Codex 负责人 Tibo 宣布「28 天计划」首日交付速度优化:GPT-6 Astra 与 GPT-6.1 Sol 的默认推理速度提升约 50%,达 50 TPS,官方订阅与通过 Sign in with ChatGPT 接入的 OpenCode、Pi、Amp、Devin 同步生效。此前 6.1 Sol 上线首日曾因负载暴增明显变慢,有开发者复测 4 小时后仅跑到 35 TPS。

来源:量子位
10月5日 周一

OpenAI 启动「28 天计划」为 Codex 与 ChatGPT Work 每日推送更新

OpenAI 产品与平台负责人 Thibault Sottiaux 公布「28 天计划」:未来 28 天内每天为 Codex 与 ChatGPT Work 推出一项有实际意义的更新,未达标则给一次「重置」,覆盖用户与额度暂未说明。前一天他称团队已「锁定方向」,重点是简化产品与开发新模型。

来源:IT之家

Meta 开源 Muse Gadgets 项目 开发者可自建接入 Muse 的硬件

Meta 为其个人 AI 智能体 Muse 推出开源项目 Muse Gadgets:开发者可自行设计并制造接入 Muse 的硬件设备,项目向外部开放,Muse 本身可代用户订行程、填表单与购物。Muse 上线约三周下载量已突破 500 万次,是美国最快达到该量级的 AI 应用。

来源:TechCrunch
10月4日 周日

谷歌向免费用户开放 Gemini Skills 自定义技能服务

谷歌向所有免费账户用户开放 Gemini 的自定义技能 Skills,打破此前仅限 Pro、Ultra 付费订阅的限制,免费用户可在主聊天框输入斜杠「/」加指令快速调用预设技能。原有 Gems 自定义配置全部保留并可继续新建,按规划 Gems 将于下月自动迁移并入 Skills,无需手动操作。

来源:太平洋科技

字节旗下豆包接入出行服务 覆盖订机票、火车票与打车导航

字节跳动旗下 豆包 正式接入出行服务,覆盖机票、火车票预订、打车叫车与地图导航四类场景,用户可在豆包内完成查询、比价、下单及退改签全流程,无需跳转第三方平台。机票走航班管家、火车票走高铁管家、打车接曹操出行,通过入口成交的酒店订单渠道费率约 12%——这层账本变化,老高AI观察第17期已做过拆解。

来源:IT之家

OpenAI 推出 Decisions API 让 AI 在预设选项里做选择题

OpenAI 推出由 GPT-6 Luna 驱动的 Decisions API,把模型能力收窄为「预设问题+有限答案集合」的单次决策,只返回选中答案与置信度、不生成文字。官方称端到端响应约 150 毫秒,较常规调用 Luna 的约 1.6 秒快约 10 倍,用于内容分类与工单路由;目前仅限量预览,定价未公布。

来源:IT之家
10月3日 周六

Black Forest Labs 发布 FLUX 3 Image 图像生成与编辑模型

德国 AI 公司 Black Forest Labs 发布图像生成模型 FLUX 3 Image,支持生成最高 4K 分辨率图片。模型基于 FLUX 3 基座开发,用户可在归一化 0–1000 坐标网格上为每个元素指定 ID、描述与边界框,实现精准排布;单次生成最多可融入 10 张参考图像,并支持像素级多轮局部编辑。该模型目前通过 API 提供服务,开放权重版本将于数周内公开。

来源:IT之家

OpenAI 为 ChatGPT 上线虚拟试穿与收藏功能

OpenAI 为 ChatGPT 上线虚拟试穿与收藏两项购物功能,面向全球移动端与网页端同步开放。用户在服饰、配饰商品页点击「试穿」并上传自拍,即可生成上身效果图,参考照片可反复复用;收藏功能把看中的商品存入 ChatGPT Library 备查。功能基于 ChatGPT Images 2.5 图像模型,OpenAI 称其图像模型每周生成的图片已超 30 亿张。

来源:IT之家

中国大模型首次进入 OpenAI 企业付费结算体系(Kimi K3 接入 Codex 企业通道)

Baseten 与 OpenAI 达成合作,成为 OpenAI B2B 市场首批开源模型推理服务商。企业用户可通过 Codex 与 Responses API 调用 Kimi K3、GLM 5.3 等开源模型,中国开源模型首次进入 OpenAI 企业采购体系。Kimi K3 由月之暗面开发,官方称其为首个参数规模达 2.8 万亿的开源模型,上下文窗口 100 万 Token。

来源:IT之家

字节跳动将为豆包推出独立个人助手 App「小豆」

字节跳动将豆包在个人助理方向推进的探索项目定名为独立 App「小豆」,该项目内部代号「Spell」,由豆包手机助手团队主导,名称于今年暑期确定,目前处于内部测试阶段,最终对外版本仍可能调整。豆包手机助手此前已与努比亚合作完成技术预览与消费版落地,小豆可视为把手机端积累的个人助理能力延伸到独立应用,使用时不再受手机品牌与系统集成的限制。

来源:IT之家
10月2日 周五

Meta Muse 上线三周下载量突破 500 万次

Meta 旗下 AI 助手 Muse 上线约三周下载量突破 500 万次,登顶美国 App Store 免费榜并连续 12 天保持榜首。Sensor Tower 数据显示,达成同样规模所用时间短于 ChatGPT 的 56 天与 Grok 的 103 天;美国市场同期仅 23 款应用在 22 天内达成这一量级。Meta 近期加大 Muse 广告投放,当日下载量环比增长 73%。

来源:IT之家

微软发布首个实时流式语音转写模型 MAI-Transcribe-2-Streaming

微软发布首个实时流式语音转写模型 MAI-Transcribe-2-Streaming:讲话进行中即持续输出文字,覆盖 60 种语言并支持自动语言检测,最终词错误率 2.50%、延迟 0.13 秒,两项列 Artificial Analysis 流式转写评测第一;经 Microsoft Foundry 与 OpenRouter 提供。

来源:IT之家

蚂蚁百灵发布长上下文通用大模型 Ling-3.1-flash

蚂蚁百灵发布长上下文通用大模型 Ling-3.1-flash:约 560B 总参数、激活约 25B,上下文上限 100 万 tokens。知识工作评测 GDPval-AA v2.1 得 1,673 Elo,软件工程评测 FrontierSWE 75.16、医疗专业评测 HealthBench Professional 65.35;发布起两周内免费体验,长度限 256K。

来源:IT之家
10月1日 周四

谷歌发布迄今最强 AI 模型 Gemini 4 Argon,长周期代码工程基准登顶

谷歌发布迄今最强 AI 模型 Gemini 4 Argon,输出上限提至约 100 万 tokens,主攻长流程软件工程与安全防御。代码工程基准 DeepSWE v1.1 中 Argon 以 77.9% 登顶,高于 Claude Opus 5.5 的 74.2% 与 GPT-6 Astra 的 74.1%;漏洞修复基准 CWE-bench v1 以 68% 并列第一。目前仅向付费 API 客户开放。

来源:IT之家

OpenAI 为 Codex 推出掌机插件 Game Studio 用自然语言做 Game Boy 游戏

OpenAI 在开发者日联合 ModRetro 为 Codex 推出掌机插件 Game Studio:用户用自然语言描述想法,即可由 Codex 生成游戏程序。插件内置 Chromatic 模拟器,可在电脑端调试验证后串流到真机试玩,成品还能写入专用卡带。Chromatic 复刻 Game Boy Color 的外观与按键设计,兼容原版卡带。

来源:IT之家

LibTV 联合抖音上线「AI 大师公开课」首期,拆解金奖 AI 短片《合龙》

AI 影视创作平台 LibTV 联合抖音「AI 创作浪潮计划」上线「AI 大师公开课」,首期邀请 2XLabs 导演团队刘树恒、王语宸,以抖音 AI 创作大赛金奖短片《合龙》为例,从叙事、美术、表演三个维度拆解从想法到成片的创作判断,并抛出「AI 缩小了技术差距、却放大了认知差距」的观点。课程不讲提示词,可在抖音官方账号观看,后续还将邀请更多创作者。

来源:哩布哩布AI
9月30日 周三

DeepSeek 开源昇腾算力平台基础设施组件

DeepSeek 开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 编译工具、计算库与分布式通信库,与此前英伟达平台组件一一对应。TileLang 昇腾版封装 Ascend C 底层指令,已承载 DeepSeek V4 系列模型大部分训练算子,并同步开源 DeepGEMM、FlashMLA 等组件,实测性能接近硬件上限。

来源:DeepSeek

OpenAI 发布新一代主力模型 GPT-6.1 Sol 与常驻型智能体 Dots

OpenAI 举办 DevDay 2026,公布 25 项更新。新模型 GPT-6.1 Sol 重点加强智能体编程与 computer use,官方称接近旗舰 GPT-6 Astra,API 标准 Token 价格仅为后者 1/5。同步推出常驻型智能体 Dots,可跟踪长期目标、主动汇报;Codex 升级为云端软件工程团队,Agents API 获 Computer Use 能力。

来源:量子位
9月29日 周二

快手推出新一代 AI 视频生成模型 Kling 4.0

快手可灵宣布新一代视频生成模型 Kling 4.0 将于 10 月正式上线,轻量版 Kling 4.0 Flash 已随官方发布向黑金年卡会员开放抢先体验。新版本单次可生成最长 30 秒原生视频,支持最多 15 项多模态参考、10 张多关键帧控制与 2 分钟超长续拍,新增双通道立体声与 4K HDR 输出,提示词上限提升至 8000 tokens。

来源:可灵AI

Anthropic 推出最新 AI 模型 Claude Sonnet 5.5

Anthropic 推出 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,运行速度较 Claude Sonnet 5 提升 30% 以上,定价为 Claude Opus 5.5 的一半。在智能体编程评测 Terminal-Bench 4.0 上得分由 10.3% 升至 70.6%,现已在 AWS、Google Cloud 与 Microsoft Azure 同步上线。

来源:机器之心

Manus 发布 Manus 2.0 并推出个人 Agent 应用 Cue

Manus 发布大版本更新 Manus 2.0,底层换用自研 Agent 框架 Cascade,官方单项测试显示 Token 消耗降低 23.2%、任务耗时缩短 28.2%、运行成本下降 32%。新版新增常驻云电脑与事件触发自动化,桌面端升级为 Manus Studio;同步推出个人 Agent 应用 Cue,每个 Agent 拥有独立邮箱、电话、钱包与云电脑。

来源:APPSO

智谱 ZCode 发布 Trust.patch 公告 开源版更新至 v3.14.3

智谱发布致 ZCode 用户的 Trust.patch 公告,ZCode 开源版已更新至 v3.14.3,今后将与官方版本同步发布,官方表示将持续倾听大家的建议与意见。权益方面,付费用户可获 4 张周重置卡与 4 张 5 小时重置卡,一个月内回归的老用户同享上述权益;官方另限时向全体用户开放 1 亿 Token 领取,限量 10 万份。

来源:ZCode
9月28日 周一

DeepSeek 上线 DeepSeek Harness 桌面版预览 免命令行启动 Agent

DeepSeek 上线桌面版 DeepSeek Harness,登录账号或填 API Key、选定本地工作区后即可直接给 Agent 派活,无需再装 Node.js 或在终端敲命令。该版本提供标准、PTC、极简、创造四种模式,内置智能体团队、语音输入、终端、Subagent 等六个官方插件;安装包经官方证书签名,仍属预览构建且暂不支持 Linux。

来源:机器之心

美团推出新一代大模型 LongCat-2.5-Preview

美团在 LongCat API 开放平台上线新一代大模型 LongCat-2.5-Preview,延续约 1.6 万亿总参数、约 480 亿激活参数的 MoE 架构与 100 万 token 上下文。新版把图片理解原生并入基座,支持跨模态问答与视觉推理,可面向浏览器、桌面软件与设计工具执行长流程任务;官方同时给出 Codex、OpenClaw 等主流环境的接入方法。

来源:AI工具箱

MiniMax 上线文本模型 M3.1-Flash-Preview 主打原生多模态与可调推理深度

MiniMax 上线文本模型 M3.1-Flash-Preview,主打原生多模态与 100 万 token 上下文,推理深度可调,目前仅通过 MiniMax Code 与 Token Plan 提供,未开放独立 API。官方同步重置全体用户 Token Plan 额度,并开启十天签到双倍积分。模型面向日常开发,官方称覆盖问题定位、代码实现、测试验证到交付的完整闭环。

来源:IT之家

快手推出 AI 视频创作 Agent「likli」

快手推出 AI 视频创作 Agent likli,提供 macOS、Windows 桌面端,用对话方式接管写脚本、生成镜头到配音剪辑的全链路,直接交付成片。内置剧作家、配音师、商品编导等 Skill,覆盖口播带货、品牌营销、短剧漫剧三类场景;脚本分镜全程可视可改,素材存进资产中心复用。订阅会员 139 元/月起,该档官方标注每月约可完成 42 次创作任务。

来源:AI工具箱

网易有道开源子曰Live系列两款实时交互模型 R2T2 和 T3PO

网易有道开源子曰 Live 系列首批两款实时交互模型 Confucius4-R2T2 与 Confucius4-T3PO,双双登顶 Hugging Face 的语音识别与翻译 Trending 榜首。前者为真流式语音识别模型,支持 80 毫秒至 2 秒可配置流式输入,平均延迟约 200 至 600 毫秒;后者是 140 亿参数的中英同传模型,以 Apache 2.0 协议开源。

来源:网易有道
9月27日 周日

阿里达摩院发布食管癌筛查模型 DAMO EAGLE 平扫 CT 即可识别早期病变

阿里达摩院联合四川省肿瘤医院、中山大学肿瘤防治中心等机构,发布食管癌筛查模型 DAMO EAGLE,成果刊于《自然·医学》。模型无需插管与造影,仅凭胸部平扫 CT 即可识别食管癌及癌前病变,已在 3 个国家 8 万余例中验证:机会性筛查中检出敏感性 90%,癌前病变敏感性 52.5%,特异性 99.2%,低剂量 CT 上性能不降。这是达摩院第 4 个癌症筛查模型。

来源:中国新闻网

月之暗面把 Kimi WebBridge 升级为 Kimi 浏览器扩展 网页操作可录成技能

月之暗面把 4 个月前发布的浏览器自动化工具 Kimi WebBridge 升级为 Kimi 浏览器扩展,现已支持 Chrome 与 Edge。用户登录后可在侧边栏直接与 Kimi 对话,让它读取页面、点击按钮、填写表单并提取信息;新增的「把操作录成技能」能把一次演示的网页流程保存为可复用技能。原本地 Agent 调用扩展的方式继续保留。

来源:量子位

谷歌为 Gemini 3.8 Live 上线 Live Avatar 虚拟人 支持 97 种语言

谷歌正式为 Gemini 3.8 Live 上线 Live Avatar 功能,向 Gemini Enterprise 企业客户开放。该功能把接近实时的视频生成与语音结合,实现精准唇形同步与自然表情,可在 97 种语言之间无缝切换且画面不漂移,并支持后台异步工具调用。企业可用单张参考图生成专属形象,全部输出均嵌入 SynthID 隐形水印。

来源:IT之家

Epoch AI 家具组装基准公布 GPT-6 Astra 以 80% 准确率登顶

Epoch AI 公布家具组装基准测试(FAB),用 60 张宜家家具组装照片考察模型的空间推理能力。OpenAI 的 GPT-6 Astra 以 80% 准确率居首,Anthropic 的 Claude Opus 5 为 61%,而此前领先模型仅有 28%。GPT-6 Astra 单张照片分析中位耗时约 3 分钟,比此前领先模型快 2 至 10 倍。

来源:IT之家
9月26日 周六

DeepSeek 公开 DSec 弹性计算沙箱 支撑百万级 Agent 训练

DeepSeek 公开系统论文,首次披露生产级沙箱平台 DeepSeek DSec。一个生产单元约 160 个 CPU 节点、3 万个核心、250TB 内存,每天服务约 300 万个沙箱,峰值并发超 38 万个,创建速率超每秒 5000 个;DeepSeek-V3.2 到 V4.1 的全部 Agentic RL 训练都跑在其上。论文还记录了智能体绕过访问控制等作弊行为。

来源:新浪财经

小米 MiMo-V3 采用全新架构 核心 HySparse2 公开

小米 MiMo 大模型负责人罗福莉宣布,小米 MiMo-V3 将采用全新自研架构,核心组件 HySparse2 已同步公开。面向长程多轮智能体任务,它在 100 万 token 上下文下把预填充计算量降低 5.02 倍、KV 缓存缩小 4.5 倍,长上下文检索评测得分更高。HySparse2 以 KV 桥接与复用两级共享压缩冗余计算,提升长文本检索精度。

来源:IT之家

微软发布 Ink Canvas 数字画布 AI 把笔迹变成内容

微软在骁龙峰会上发布 Microsoft Ink Canvas,一款面向 Windows 11 的笔优先画布,把手写笔记、草图、批注与 AI 能力整合进同一工作区,圈选手写内容即可让 AI 摘要、润色或生成 HTML 代码,并接通 Copilot。它适配新款 Slim Pen,新款 Surface Pro 12 英寸将预装,其余兼容设备将于下月 13 日起在微软应用商店下载。

来源:IT之家

谷歌确认 Gemini 4 已进入后训练 目标远早于年底推出

谷歌 DeepMind 负责人科拉伊·卡武克奥卢在 The Information 峰会上确认,Gemini 4 已进入后训练初期,目标是远早于年底推出,目前处于防护机制开发与安全测试阶段,谷歌工程师已在内部用它运行 Antigravity 编程工具。作为 Gemini 3 系列之后首款下一代旗舰,它主打编码、自主智能体与长程任务,谷歌称其规模显著更大。

来源:新浪财经

Meta 把个人智能体 Muse 装进 AI 眼镜

Meta 在 Connect 2026 大会上宣布,把个人 AI 智能体 Muse 带进 AI 眼镜,未来数月内上线,唤醒后可直接理解眼前画面并发起操作,无需再向 AI 描述所见的物品。Muse 由 Muse Spark 驱动,可代用户发信、订票、比价与下单,同步接入沃尔玛、百思买、丝芙兰等十余家连接器,并新增实时数字形象与专属邮箱。

来源:Meta 官方新闻室
9月25日 周五

华为小艺 Work 正式上线

华为正式上架 AI 工作助理 小艺 Work,定位 7×24 小时在线的办公执行体,覆盖市场调研、文档处理、PPT 制作、数据分析、内容创作与代码开发。用户给出目标后,系统自主拆解任务、调度工具并推进执行,关键环节可人工复核。电脑端提供云电脑与本地双执行环境,后台可持续运行,任务结果自动同步至手机;新用户首享 31 天 1000 AI 点免费额度。

来源:小艺 Work 官网

高通携手 PrismML 推出 1-bit Bonsai 端侧视觉语言模型

高通携手 PrismML 在骁龙 AR1 Gen 1 智能眼镜平台本地跑通 20 亿参数的 1-bit 量化 1-bit Bonsai 视觉语言模型,眼镜离线也能识图作答。官方称同内存可容纳约 4 倍参数,权重内存占用 0.43GB、对标 4-bit 版的 1.66GB,生成速度达到同规格 4-bit 模型的 2.06 倍,模型由 Bonsai 1.7B 构建。

来源:PrismML

腾讯混元 Hy 翻译 App 正式上线

腾讯混元宣布 Hy 翻译 App 正式上线,同步提供小程序、插件与 PC 端。产品基于混元 Hy-MT2 翻译模型打造,支持 33 种语言互译,覆盖藏语、维吾尔语等 5 种少数民族语言及方言,提供语音、拍照、对话与离线翻译,支持口语化、学术等翻译风格切换,离线时可提前把模型下载至手机。现已在含美国、日本、韩国及中国港澳台地区在内的 12 个国家和地区上架。

来源:上海证券报
9月24日 周四

腾讯音乐推出 AI 音乐创作平台 MusicBuddy

腾讯音乐上线 AI 音乐创作平台 MusicBuddy,面向独立音乐人提供灵感、创作、精修、发行、宣推、经营六个环节的全链路服务。保留传统 DAW 分轨编辑形态,左侧嵌入 AI 对话面板,用自然语言完成编曲、乐器替换、混响调整与歌词改写;内置多套音乐模型,支持选择人声与上传参考音乐。作品完成后可一键分发至 QQ 音乐、酷狗等平台,自动生成 MV 与宣推海报。

来源:AI工具箱

阶跃星辰开源终端编程智能体 Step Code

阶跃星辰开源终端编程智能体 Step Code,采用 MIT License,可在终端内完成编码、调试与交付。它在 Terminal Bench 2.1 以 80.9% 通过率并列第一,Token 消耗最低;长程基准 Multi-Frame 以 73.3% 通过率居六款 Agent Harness 之首,平均 5.09M Tokens,内置 StepPage 一键发布静态站点。

来源:阶跃星辰开放平台

阿里通义推出语音大模型系列 Qwen-Audio-3.1

阿里通义在云栖大会发布 Qwen-Audio-3.1 系列五款语音大模型,覆盖语音识别、语音合成、实时交互与音频创作。ASR 支持 30 种语言与 16 种中文方言,首字响应约 160 毫秒;TTS-Next 可一次生成人声、音效与环境音。API 已上架千问 AI 平台,Qwen-Audio 全线价格同步下调,最高降幅 95%。

来源:阿里语音AI

蚂蚁开源图像生成模型 Ming-Image-0.1-Design

蚂蚁集团 inclusionAI 开源 Ming-Image-0.1-Design 系列,含两个 6B 模型:Design 专攻 UI、海报等文字密集型设计,原生输出透明背景素材;Layer 把成品图拆成 2—9 个可编辑图层。Design 以 Elo 1082 登顶 Artificial Analysis 设计开放权重榜,Layer 在 Crello 评测 12 项全部第一。

来源:百灵大模型

中国电信星辰实验室开源文档解析模型 TeleOCR

中国电信星辰实验室开源文档解析模型 TeleOCR,以约 1.2B 参数的轻量视觉语言架构统一处理数字文档与拍摄文档,把文字、版面、表格、公式与科学图表转为结构化结果。它在 OmniDocBench v1.6 以 96.87 分登顶,超过 OvisOCR2 的 96.58 分,表格 TEDS 达 97.05,并采用形变感知学习与几何感知建模,省去独立去畸变模块。

来源:中国电信天翼AI

爱派AiPy正式上架银河麒麟软件商店

AI 自动化工具爱派AiPy 正式上架银河麒麟软件商店,支持一键安装。它以「大模型 + Python 执行环境」为底座,可用语音或自然语言派发任务,覆盖数据分析、文档与 PPT 批量生成、网页采集、量化回测等场景,支持内网本地化部署与国产大模型接入,并提供沙盒权限、删除保护、加密传输、审计日志与工作空间隔离等安全能力。

来源:爱派AiPy
9月23日 周三

OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款模型

OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,沿用 GPT-6 Astra 的训练方法,把 Astra 在专业工作、事实性、编程、计算机使用与对齐上的顶尖能力下放到更快、更经济的小尺寸模型,官方称 Astra 仍是无妥协首选。两款模型的 API 价格较 GPT-5.6 促销价下调 50%,单任务成本最低不到竞品一成。

来源:量子位

Anthropic 推出 Claude 5.5 系列首款模型 Claude Opus 5.5

Anthropic 发布 Claude 5.5 系列首款模型 Claude Opus 5.5,官方称多数任务表现与 Claude Fable 5.1 相当,典型任务成本较上代 Claude Opus 5 降低 40%、输出速度提升超 30%,模型已上线 Claude 与亚马逊云、谷歌云、微软 Azure,并被 Claude Code v2.1.280 设为默认 Opus 模型。

来源:APPSO

爱诗科技正式推出通用实时世界模型 PixVerse R2

爱诗科技正式发布全球首个具备 Scaling 能力的通用实时世界模型 PixVerse R2,开放游戏、互动影视与数字人体验间,支持 WASD 控制角色移动与 Prompt 实时改写环境。模型以 Omni Causal AR 与 Real-Time Acceleration 解耦能力与实时性,块稀疏注意力稀疏度超 90%,Error Bank 让画面漂移下降约 35.8%。

来源:爱诗科技 AIsphere

阿里推出面向手机场景的 AI 全栈方案 Qwen Intelligence

阿里推出面向手机场景的 AI 全栈方案 Qwen Intelligence,不造硬件,向手机厂商输出场景优化模型、可定制平台与垂域 Agent。其中 Mobile Planner 负责任务拆解与记忆,每千次任务成本约 2.41 美元;Mobile-Use 以 API 优先、GUI 兜底方式自动操作,端到端成功率 90%、时延降低 28.8%。

来源:千问大模型

腾讯混元推出专业级生图模型 Hy Image3.5 preview

腾讯混元推出专业级生图模型 Hy Image3.5 preview,综合能力较 3.0 版本提升约 30%,在专业设计师盲测中与 Seedream 5.0 Pro 持平。模型支持文生图、图生图、多轮对话编辑与 2K 分辨率输出,API 定价 0.15 元/张,已上线 腾讯元宝、ima.copilot、Miora 等应用,主打高性价比的专业创作。

来源:腾讯混元
9月22日 周二

月之暗面推出 Kimi Code 官方桌面客户端 Kimi Code Desktop

月之暗面把 Kimi Code 编程智能体从命令行搬进桌面,推出官方客户端 Kimi Code Desktop,macOS 与 Windows 同步上线。打开本地文件夹即可对话驱动 Agent 读写代码、执行命令,内置终端、浏览器与 Git 面板;权限分始终询问、必要时询问、完全自动三档,另有 Plan、Goal、Swarm 三种模式。

来源:月之暗面 Kimi

SpaceXAI 推出最新旗舰大模型 Grok 4.7

SpaceXAI 推出新一代旗舰模型 Grok 4.7,参数从 Grok 4.6 的 1.5 万亿提升至 2.1 万亿,定价维持每百万输入 2 美元、输出 6 美元。官方数据显示 CursorBench 4.0 得分 46.3%,Terminal-Bench 4.0 从 20.3% 升至 38.0%,GDPval 升至 1695 分,已上线 xAI API 与 Cursor。

来源:机器之心

小米开源全模态模型系列 Xiaomi MiMo-V2.6

小米开源全模态模型系列 Xiaomi MiMo-V2.6,Pro 为 1.02 万亿参数、每 token 激活 42B,Flash 为 3090 亿参数、激活 15B,均支持 100 万 token 上下文与文本、图像、视频、音频输入,以 MIT 许可开放权重。Pro 在 Artificial Analysis 智能指数取得 46 分,API 定价与 MiMo-V2.5 持平。

来源:Xiaomi MiMo
9月21日 周一

剪映推出一站式 AI 视频创作入口「剪映Hub」

剪映专业版上线一站式创作工作台 剪映Hub,由无限画布与多轨道编辑器构成:可从一句话、一个参考视频或一份文档出发梳理脚本,调用 即梦AI、小云雀 等平台生成图片、视频与音频素材,再进多轨道精修,省去跨软件导入导出。配套的剪映助手 Agent 可代做素材整理、口播删减与字幕纠错,首期计划上线 20 余个官方精品 Skill。

来源:量子位

LibTV 1.5 版本更新,五大独家功能升级创作全流程

AI 影视创作平台 LibTV 发布 1.5 版本,一次性补齐五大功能:角色造型室可对五官、发型、服饰逐项可视化调整并存为角色卡复用;剧本创编在改写台词时会提示对大纲与伏笔的连带影响;导演分身能导入个人创作方法,自动拆分镜并批量优化提示词;3D-BOX 虚拟影棚无需建模,对话即可搭景、画线预演运镜;成片精修提供创意片头、字幕调整与口播粗剪。

来源:LibTV

阿里通义团队开源图像模型 Qwen-Image-2.1

阿里通义开源图像模型 Qwen-Image-2.1,视觉生成部分参数量 7B,采用 32 层 Single-Stream DiT 架构,原生支持透明图像生成与透明图层编辑,单次最多参考 10 张图,并提供圈选、涂抹等局部编辑,在 Qwen-Image-Bench 上以 60.28 分成为该榜开源模型最高分,模型以研究许可发布、禁止商业使用。

来源:千问大模型

阶跃星辰推出旗舰模型 Step 5 Preview

阶跃星辰推出旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构、总参 600B/激活 27B,支持 100 万 Token 上下文与原生文本、视觉输入,Artificial Analysis 智能指数 44 分,单任务成本为 Claude Opus 5 的 1/8,代码评测覆盖 553 个仓库、9 类任务与 33 种语言,完整权重尚未释放。

来源:阶跃StepFun

阿里智能体工作台 Qoder 正式上线 Qoder Sites

阿里 Qoder 正式上线 Qoder Sites,用户一句话即可构建并发布网页应用、生成分享链接,支持权限管理。与多数 Vibe Coding 产物不同,Qoder Sites 能同步创建后端数据库,页面数据可持久保存、状态持续更新,还可绑定 Qoder Cloud Agents 接入 Agent 能力;Qoder v0.3.3 与 CLI v1.1.54 已全面支持。

来源:阿里云

MiniMax 开源命令行 AI 编程工具 MiniMax Code CLI

MiniMax 把命令行 AI 编程工具 MiniMax Code CLI(MMX-CLI)的 v0.4.12 版本源码开源到 GitHub,采用 MIT 协议。它在 FrontierHarness Eval 中任务通过率 76.7%、成功任务耗时中位数 4 分 33 秒,两项均优于公开基线;官方称开源意在让开发者审查工具的调用逻辑与权限处理方式。

来源:MiniMax 稀宇科技

阿里 HappyOyster 1.0 系列世界模型上架阿里云百炼

阿里 HappyOyster 1.0 系列世界模型正式上架阿里云百炼,主打实时生成、持续演化的开放世界体验,开发者无需邀测即可直接调用 API。Adventure 可基于文本或图像生成可自由探索的开放世界,支持实时移动与镜头控制;Directing 能在世界生成后用文本指令实时驱动角色、剧情与镜头,目前仅支持新加坡与美国(弗吉尼亚)地域。

来源:阿里云百炼

智谱正式开源 ZCode

智谱正式开源旗下编程工具 ZCode,源码托管到 GitHub,涵盖桌面端、Web 工作区、后端、Agent CLI 与运行时,官方同时为代码上传争议致歉,承诺数据无留存、从未用于模型训练。客户端 v3.14.0 已移除 Repo Wiki 功能并切断本地仓库快照上传链路,信通院评测确认其阿里云 OSS 存储桶为零数据状态。

来源:ZCode
9月20日 周日

Figure 推出全身人形机器人 VLA 基础模型 Helix 2.5

Figure 正式推出全身人形机器人 VLA 基础模型 Helix 2.5,在 30 户从未采集过数据的陌生家庭中完成整理客厅、折叠毛巾、铺床三类长时序家务,零样本全身任务成功率达 56%,而从零训练的策略仅 9%。其泛化能力来自 Index 人类行为数据集预训练,任务专用数据用量约为上一代 Helix 02 的一半,硬件载体为 Figure 03 人形机器人。

来源:AI工具箱

阿里通义推出端到端实时同声传译模型 Qwen3.8-LiveTranslate

阿里通义正式推出端到端实时同声传译模型 Qwen3.8-LiveTranslate,字均延迟(LAAL)降至 2.3 秒,支持 60 种语言音频输入与 29 种语言语音输出。基于 Hybrid MoE 的 Thinker–Talker 双模块把音频与文本压进同一条交织序列,并新增实时说话人分离,14 个语向的流式分离错误率为 9.7%。

来源:AI工具箱

xAI 推出实时语音转写模型 Grok Voice Transcribe 2.0

xAI 正式推出实时语音转写模型 Grok Voice Transcribe 2.0,在 Artificial Analysis 的 32 个流式转写模型中准确率排名第一,19 种语言短句的词错误率降至 6.8%。批量转写 0.10 美元每音频小时、流式 0.20 美元;说话人分离、词级时间戳与每请求 100 个术语偏置均不额外计费。

来源:AI工具箱

OpenAI 在 Microsoft Word 上线 ChatGPT 官方加载项,免费档位同样可用

OpenAI 将 ChatGPT 以官方加载项形式接入 Microsoft Word,与 Excel、PowerPoint 共用同一个加载项,覆盖包括 Free 在内的全部订阅档位。侧边栏可从笔记起草、汇总长文、改写选段并统一标题格式;免费与 Go 档调用 GPT-5.6 Luna,付费档才给 GPT-5.6 Sol,按 token 计费并与 Codex 共享额度。

来源:IT之家

Anthropic 为 Claude Code 新增 AGENTS.md 通用智能体配置支持

Anthropic 为旗下智能体编程工具 Claude Code 的 2.1.277 版本新增对 AGENTS.md 的支持,开发者可用一份通用配置文件统一描述智能体的角色、工具与运行约束,无需为不同产品重复维护提示词。AGENTS.md 正成为 OpenAI 与 Anthropic 共同采纳的跨厂商智能体标准,同一份配置即可在多个智能体产品间复用。

来源:IT之家
9月19日 周六

OpenAI 推出 Astra for Law 法律AI基础平台

OpenAI 正式推出 Astra for Law 法律AI基础平台,法律检索索引收录超 2.3 亿个 URL,判例部分覆盖 99.9% 以上已发布的美国先例判例法。在 ValsAI 的 200 道题中,其正确率 54.0%,高于仅用网页搜索的 GPT-6 Astra 的 38.7%,目前通过申请制 Trusted Access 计划向选定美国律所开放。

来源:AI工具箱

特斯拉推送更新 豆包大模型语音助手扩至更多车型

特斯拉推送 2026.26.200.11 版本更新,把 豆包大模型 语音助手扩展到更多车型。该功能需订阅高级车载娱乐服务,支持多音色角色切换与自然口语交互,并同步升级宠物模式自定义、盲点警报氛围灯与开门预警,用户在车机端登录豆包账号后即可启用,豆包大模型的语音能力也正从手机与办公场景持续延伸到车载终端,逐步成为车机端的主要交互入口。

来源:AI工具箱

阿里千问上线高德门店经营专家套件 覆盖 10 项技能

阿里千问为 千问办公 上线高德门店经营专家套件,整合选址顾问、商场洞察与门店诊断三大能力共 10 项技能,覆盖从选址评估到日常经营分析的全链路,把商圈数据与经营诊断收进同一入口。用户授权高德账号后即可调用,无需在多个系统之间来回切换,面向连锁品牌与零售团队提供一站式门店决策支持,门店拓展团队不必再逐个平台重复取数。

来源:AI工具箱
9月18日 周五

阿里千问推出新一代原生全模态模型 Qwen3.8-Omni-Flash

阿里千问推出新一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频与视频输入及 1M 长上下文,30 项评测较上代平均提升超 26%,音频能力整体超越 Gemini 3.8 Flash,API 音频输入价格降幅超 98%。模型可端到端完成视频剪辑、短剧翻译、电影解说与会议纪要执行等长程工作流,面向需要把音视频素材直接产出成稿的团队。

来源:千问大模型

智谱推出高速推理模型 GLM-5.3-FlashX

智谱推出高速推理模型 GLM-5.3-FlashX,最高推理速度达 200 tokens/s。模型此前以「Ox Alpha」代号与开发者见面,调用量持续攀升,此次基于 10 万张国产芯片的推理算力加大 Infra 侧投入与推理优化。前代 GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速形成智能、价格与速度的全面竞争力。

来源:智谱

腾讯正式推出 AI 游戏创作平台 「游点灵」

腾讯 AI 游戏创作工具「代号 Craft」正式定名为 游点灵 CraftBuddy,新名称延续「Craft」并融入伙伴概念,定位为用户的「AI 游戏创作搭子」。用户可访问 craft.qq.com 体验由游点灵创作的游戏,创作资格正陆续发放,关注官方渠道可获取活动消息。

来源:AI工具箱

Kimi 发布金融行业解决方案

月之暗面正式发布 Kimi 金融行业解决方案,整合 10+ 权威数据源、9 项金融技能与 5 项合规措施。方案与中信建投证券共建「风险评估网关」,试点覆盖 50 余家发行人、100 余只存续公司债券,单份受托报告制作时间由约 30 分钟缩短至 10 分钟、人工投入下降 67%。方案已全面上线,覆盖网页版、Kimi Work 及企业级托管智能体,数十家金融机构已接入。

来源:月之暗面 Kimi
9月17日 周四

腾讯推出 AI 原生语音输入助手 Chatterfly

腾讯推出的 AI 原生语音输入助手 Chatterfly 进入内测,主打 Fn 键口述即出成稿,内置会议纪要、工作汇报、营销文案等 6 个可独立开关的场景技能,并可持续记忆个人表达习惯。它把语音输入从「打字替代」推进到「口述—润色—成稿」一条链路,面向需要在桌面端快速把想法落成文稿的用户。

来源:AI工具箱

科大讯飞推出全国产语音基座大模型 Spark-Audio-1.0-Preview

科大讯飞上线全国产语音基座大模型 Spark-Audio-1.0-Preview,采用 0.65B 语音编码器配 30B-A3B MoE 解码器,支持 99 种语言与 202 种方言,在 Fleurs 中文测试集上达到 SOTA。模型可在弱网、嘈杂、轻声等环境下保持稳定识别,并开放体验入口,面向需要高精度语音转写与实时对话的场景。

来源:科大讯飞

腾讯云开源自托管 AI 助手 Octop 发布 1.0 正式版

腾讯云自研的开源自托管多用户 AI 助手 Octop 发布 1.0 GA 正式版,采用 MIT 协议,GitHub 星标已突破 3000。本次更新补齐 RAG 知识库公共与私有分级检索、页面与功能级 ACL 权限、Token 额度限制与专家沙箱隔离;同步上线 macOS、Windows、Linux 桌面客户端与飞牛 NAS 应用,并在腾讯云轻量应用服务器 Lighthouse、云服务器 CVM 镜像市场上架官方镜像,一条命令即可把 AI 协作中枢部署在自己的机器上。

来源:腾讯云服务器
9月16日 周三

生数科技推出实时交互与编辑视频模型 Vidu S2

生数科技推出 Vidu S2,包含 S2-Avatar 与 S2-Editing 两款模型。S2-Avatar 把实时输出分辨率提升至 720P、帧率达 25–42 FPS,支持对话中动态更新参考图并连贯完成摘戴帽子等动作;S2-Editing 可对输入视频流实时完成风格迁移、虚拟试穿、人物替换与背景替换四类编辑。S2-Avatar 在 StreamAV-Bench 九项指标全部居首,S2-Editing 在 OpenVE 与 RefVIE 联合评测取得 4.26 综合分。

来源:生数科技

科大讯飞推出全场景 AI 生产力工作台 AStudio

科大讯飞推出桌面 AI 生产力工作台 AStudio,以星火 X2.5 为核心,搭载自研 ACode Harness 智能体执行内核,支持多模型切换、Plan 规划与目标 Goal 两种运行模式及多智能体协作。产品划分日常空间与项目空间,可连接本地文件与真实项目,直接交付文档、网页、代码等成果并完成验证,已接入支付宝、高德、飞书等第三方工具。

来源:讯飞开放平台

谷歌推出原生实时语音对话模型 Gemini 3.8 Live

谷歌推出原生实时语音对话模型 Gemini 3.8 Live,同时提供标准版与 Extended Thinking 版两个版本。标准版主打规模化部署与成本优化,支持 97 种语言自动切换、近实时视觉理解与后台工具调用;Extended Thinking 版强化多步推理,可让模型在推理的同时持续发言,并在多项语音质量基准测试中排名第一。它与此前发布的推理与编码模型 Gemini 3.8 形成能力互补。

来源:IT之家

豆包工作模型上新,同时推出「豆包工作伙伴」

豆包官宣两大更新:豆包 2.1 Pro 模型完成 0915 小版本升级并全量上架火山方舟,同时推出 AI 办公协作智能体「豆包工作伙伴」。该智能体以独立身份加入飞书群聊、文档与会议,拥有自己的权限与记忆,可随 @ 随到、主动补位,承接资料整理、深度调研与进度跟进等任务。豆包工作覆盖群聊、文档、会议与电脑操作四类入口,企业可对其权限、额度与数据范围做集中治理。

来源:豆包工作
9月15日 周二

上海 AI Lab 开源多模态基础大模型「书生-S2」

上海人工智能实验室开源基础大模型书生-S2,通用能力居开源第一梯队,生物、材料、化学及 IMO-Proof / AdvancedMathBench 等科学长程任务比肩顶尖闭源。模型通过 Memory Decoder 架构引入可插拔专业记忆模块,兼顾领域扩展与通用能力;并强化长程推理与智能体执行。

来源:书生Intern

宇树开源通用人形基础模型UnifoLM-WLA-1.0

宇树科技宣布全开源新一代通用人形机器人基础模型UnifoLM-WLA-1.0,代码、模型与数据集同步开放。模型基于大规模多模态感知理解与交互中心世界建模训练,使用约 2500 小时真机数据;多项具身推理评测领先开源模型、比肩头部闭源模型,真机可单模型统筹 64 个任务,覆盖桌面与全身移动操作,具备跨任务、跨末端执行器泛化。

来源:Unitree宇树

阶跃星辰推出语音大模型系列 StepAudio 3

阶跃星辰推出StepAudio 3系列语音大模型,含 Realtime、ASR、TTS、Gen、Music 五款,多款在 Artificial Analysis 榜单全球第一。Realtime 以 98.9% 综合得分登顶实时语音交互榜首,ASR 词错误率仅 1.7% 并列第一。模型覆盖实时对话、语音识别、真人级合成、全音频生成及音乐创作。

来源:阶跃StepFun

智象未来推出全模态视频生成模型 HiDream-O1-Video-1.0

智象未来推出首款原生全模态视频模型HiDream-O1-Video-1.0,支持多模态输入,一键直出 5-20 秒 1080p 视频,在意图理解、物理规律、叙事规划及音画一体化生成上全面升级,获 Artificial Analysis 图生视频榜全球第四、Arena.ai 榜第 8,标志中国 AI 视频进入全球第一梯队。

来源:HiDream智象元一
9月14日 周一

月之暗面 Kimi 推出新一代主力模型 K2.8 Preview

月之暗面将新一代主力模型 Kimi K2.8 Preview 全量上线 Kimi Code 与 Kimi Work,全部会员档位开放最高 1M 上下文窗口。官方称其综合性能接近旗舰 Kimi K3,思考效率较 Kimi K2.7 Code 显著改善,支持 low/high/max 三档 thinking effort 以及图片、视频输入,本次预览未公布任何基准测试数据。此前 Kimi K3 带动公司年度经常性收入(ARR)在两个月内从 3 亿美元增至 10 亿美元以上。

来源:量子位

亚马逊云科技推出企业级 AI 工作助手 Amazon Quick

亚马逊云科技将企业级 AI 工作助手 Amazon Quick 桌面端在 macOS、Windows 正式开放,并在 iOS、Android 端上线动态信息流:邮件、消息、CRM、日历汇入按优先级排序的视图,Agent 处理完的事项自动消失,只留需人工判断的队列。个人档 20 美元/月起,Professional 与 Enterprise 档每月 Agent 时长分别由 4、8 小时提升到 8、18 小时,并取得 HIPAA、FedRAMP、SOC 2、ISO 27001 认证。

来源:亚马逊云科技

蚂蚁灵波科技开源实时交互世界模型 LingBot-World 2.0

蚂蚁灵波科技开源实时交互世界模型 LingBot-World 2.0 系列三款模型:Small 仅 1.3B 参数,面向消费级单卡 GPU,可在单卡上实时生成世界;Bidirectional 作为双向 Teacher 模型提供高质量蒸馏源;Causal Pretrain 提供因果预训练底座,支持相机位姿与文本提示两类输入。该系列可小时级连续生成不漂移,高配推理下达到 720P/60FPS。与同类世界模型 Zing-0.5 相比,1.3B 版本把本地实时运行门槛进一步压低。

来源:蚂蚁灵波科技
9月13日 周日

谷歌 DeepMind 推出 AlphaGenome Atlas 全基因组变异图谱

谷歌 DeepMind 正式推出全基因组变异效应预测图谱 AlphaGenome Atlas,覆盖人类基因组全部单碱基变化的效应打分,配套交互式浏览器与 API,可服务于遗传病位点解读与基因编辑脱靶评估。

来源:AI工具箱

微软为 Microsoft 365 Copilot 推出自主智能体 Project Opal

微软正式为 Microsoft 365 Copilot 推出自主 AI 智能体 Project Opal,可在企业级云桌面自动执行审计、HR 入职等跨系统任务,支持实时监控与人工接管。

来源:AI工具箱

微软发布 VS Code 1.137 支持按计划调度 AI 智能体

微软正式发布代码编辑器 VS Code 1.137,支持让 AI 智能体按预设计划自动执行编辑、运行与提交,并新增代理式终端与多文件重构能力。

来源:AI工具箱
9月12日 周六

小米开源目标说话人语音识别大模型 Xiaomi-CocktailASR-1

小米正式开源目标说话人语音识别模型 Xiaomi-CocktailASR-1,可通过参考音频锁定目标说话人并只转录其发言,LibriMix 2mix 测试集上词错误率(WER)低至 4.11%,通用模型 Qwen3-ASR 为 68.75%;权重与代码以 Apache 2.0 协议开放。

来源:AI工具箱

Cursor 开启 Projects beta 支持数千子智能体并行

Cursor 正式开启 Cursor Projects beta,由协调智能体跨数月维护项目上下文,向数千个子智能体并行派发任务,合上笔记本后仍在云端运行;支持订阅 Slack 频道、PR 与定时任务触发,实现无人值守交付。

来源:AI工具箱

OpenAI 开放 Agents API 公测并开源 Codex harness

OpenAI 正式将驱动 Codex 的智能体框架以 OpenAI Agents API 开放公测,一次调用即可拉起生产级 agent,会话编排、上下文压缩与子智能体并行全部托管;不收额外 API 费用,仅按 token 与工具用量计费,底层 Codex harness 同步开源。

来源:AI工具箱
9月11日 周五

基元律动联合无问芯穹推出 Agent-Native 模型 NeoHorse-1

基元律动联合无问芯穹与清华大学、北京大学、香港中文大学、阿里巴巴等推出开源 Agent-Native 模型 NeoHorse-1,提供 4B 与 9B 两个版本,原生支持 262,144 tokens 上下文。模型训练数据取自 Harness 结构化执行轨迹,官方十项基准宏平均 69.04,高于同规模 Qwen3.5-9B 的 65.60 与 Gemma-4-12B-it 的 63.51,tau²-Bench 智能体评测达到 90.82。

来源:基元律动

OpenAI将实时语音模型 GPT-Live-1 上线 API

OpenAI 正式将 GPT-Live-1 上线 API,把全双工语音能力开放给开发者调用。前端语音层按 0.05 美元/分钟计费,模型将语音理解与输出合并进同一个模型,轮次延迟降至 0.798 秒;官方称全双工基准得分提升 30 个百分点,搭配 GPT-6 Astra 可在语音智能体评测中排名第一,支撑餐厅预订、客服等电话场景。

来源:IT之家
9月10日 周四

DeepSeek 正式开源 V4.1 Flash

DeepSeek 正式开源多模态模型 DeepSeek V4.1 Flash:552B 总参 MoE 架构,输入仅激活 8B、输出 16B,原生支持多模态并大幅压缩 KV Cache,显著降低 Agent 场景推理成本。API 已同步上线,调用名改为 deepseek-flash,腾讯 WorkBuddy、CodeBuddy 与 OpenCode 已完成全量接入。

来源:DeepSeek

阿里 Qoder 国际版上线内置模型 Sonus

阿里 Qoder 国际版新增内置模型 Sonus,主打超长自主任务执行与电脑操作能力。配合 Qoder 桌面端 0.2.3 版本优化,Sonus 可直接操控电脑及各类专业软件,自主完成编程、金融建模、科学研究、制作电子表格等复杂任务。

来源:Qoder

蚂蚁开源原生多模态大模型 Ling-3.0-flash-VL

蚂蚁百灵开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL,总参数 124B、单次推理仅激活 5.5B,原生支持图像、文本、视频与 256K 上下文,BF16 与 FP8 权重以 MIT 协议上架 Hugging Face。模型引入「观察—行动—验证—修正」视觉反馈闭环,在 Artificial Analysis 评测中较纯文本版提升 4 分,面向网页复刻、GUI Agent 与医疗报告解读场景。

来源:蚂蚁百灵 inclusionAI

Meta 推出首款个人智能体 Muse

Meta 正式发布首款个人智能体 Muse,已在美国上线 iOS、Android 与 Web 端,可自主完成发送邮件、预订行程、在线购物等任务。产品提供免费档与 20、100 美元月订阅;每个用户的 Muse 运行在独立的云端专用沙箱中,发送邮件或完成购物前需用户确认,对话数据不进入广告系统,底层模型为 Muse Spark 1.3。

来源:IT之家

ChatGPT 语音模式支持调用 GPT-5.6 Sol 和 GPT-6 Astra

OpenAI 更新 ChatGPT 语音模式,用户可在语音对话中自选模型与推理深度,GPT-6 Astra 处理搜索与复杂推理,每次转交底层文本模型均计入消息额度。同步简化 GPT-Live 限额:200 美元 Pro 套餐可无限使用 GPT-Live-1,原有 Instant、Medium、High 三档独立语音智能等级停用。相关工具页见 ChatGPT。

来源:IT之家
9月9日 周三

小米开放邀测桌面AI应用 XiaoMi MiMo Desktop

小米 MiMo 团队宣布 XiaoMi MiMo Desktop 开放邀测,这款桌面AI智能体应用可直接读取表格、PDF、音视频等素材,自动拆解任务并调用工具,交付可继续编辑的文档、网页、3D 与 App;内置 Smart 调度在同会话缓存命中率最高达 99%,邀测用户可限时限量免费体验 MiMo-X-Pro-Preview 与 MiMo-X-Flash-Preview 两款新模型。

来源:Xiaomi MiMo

智象未来正式上线内容创作智能体 vivago R1

智象未来旗下内容创作智能体 vivago R1 正式面向全球用户上线,国内版「够搭」同步完成升级。产品定位全球首个无限时长内容创作智能体,可一次性稳定输出 5 分钟高质量视频并支持多轮延长,依托自研 HD-AgentOS,内容有效可用成功率达 85%,vivago.ai 全球用户已突破 7000 万。

来源:HiDream智象未来

OpenAI 推出新一代图像生成模型 ChatGPT Images 2.5

OpenAI 推出新一代图像模型 ChatGPT Images 2.5,在细节、编辑精准度和生成速度上全面升级,生成延迟较 2.0 版本降低 50%,多轮编辑一致性显著增强,能更好保留参考照片主体。目前用户每周通过 ChatGPT Images 及 API 生成超 30 亿张图片,API 同步推出 GPT-Image-2.5 Flare 与 Sunburst 两款模型。

来源:OpenAI
9月8日 周二

腾讯混元升级 Hy4 preview 模型

腾讯混元针对复杂任务中的长思考、过度自我验证等问题,对旗舰模型 Hy4 preview 完成专项升级,已通过 Bench 指标与人工评测双重监控全量上线。新版本在不损失任务效果的前提下,显著降低任务轮次及输入输出 token 消耗,效率提升明显。

来源:腾讯混元

蚂蚁集团开源统一图像生成与编辑模型 LLaDA-Image

蚂蚁集团 InclusionAI 开源 6B 参数统一图像生成与编辑模型 LLaDA-Image,搭载自条件学习与统一生成编辑架构,TwinFlow 蒸馏技术将推理步数从 50 步压缩至 2-4 步。在 Qwen-Image-Bench 中,该模型以中文、英文双料成绩位列开源第一,综合表现介于 GPT Image 1 与 Imagen 4.0 Ultra 之间。

来源:蚂蚁开源

DeepSeek内测新模型 DeepSeek V4.1 Flash

DeepSeek 开启新版旗舰模型 DeepSeek V4.1 Flash 中间版内测,定位「原生多模态低成本主力」,上下文窗口与单次 token 价格均向中小开发者倾斜,工具调用与代码生成对标自家 V4-Pro 系列同档表现。该中间版将于 9 月 10 日自动过期,开发者被引导迁移至随后正式版,是 V4 系列首次以「内测即对外开放 API」形式曝光。此前视觉多模态方向体验可参考已发布的 DeepSeek-V4-Flash-Vision-Exp。

来源:智东西

面壁智能开源端侧语言基座模型 MiniCPM5-2B

面壁智能联合 OpenBMB 开源 2B 端侧语言基座模型 MiniCPM5-2B,在 AA 榜单位列全球 4B 以下开源模型第一,综合 23 分,Agentic Index 达 20 分、约为同级十倍。项目同步开放 UltraData 数据、Meshy 框架与 JustRL II,并已完成英特尔、瑞芯微、Arm 等平台 Day0 适配。

来源:面壁智能
9月7日 周一

科大讯飞正式推出星火X2.5

科大讯飞正式推出 星火X2.5,这是基于全国产算力训练的旗舰大模型,采用 MoE 293B-A30 架构、支持 256K 上下文,重点强化代码生成与智能体(Agent)能力,并覆盖 200 余种语言,推理定价当前限时 5 折。

来源:科大讯飞

阿里正式推出 QoderWake 1.0

阿里正式推出 QoderWake 1.0,把「AI 数字员工」的管理做成企业人事系统:企业可以像招聘真人一样,对 AI 员工进行招募、培训、授权与考核,让人负责决策把关、数字员工负责执行推进。该产品将优秀员工的能力沉淀为可复用的数字化生产力,为研发、运营等多岗位提供几乎不设上限的数字化人力产能。

来源:Qoder

马斯克 xAI 将 Grok Bot 适配 iPad 与安卓,补全四大终端

马斯克旗下 xAI 将 Grok Bot 适配至 iPad 与安卓端,补齐 Mac、iPhone 后实现四大终端全覆盖。Grok Bot 定位 AI 智能体协作平台,支持多个 Agent 24 小时组队执行任务、跨应用登录并共享任务上下文,可在机器人之间传递信息、协同推进项目。目前该功能已向全平台用户开放。

来源:IT之家

阿里联合淘天开源电商经营评测基准 E-Commerce Bench

阿里联合淘天集团开源电商经营评测基准 E-Commerce Bench,让大模型以 10 万元本金在真实市场数据中经营网店 365 天,覆盖选品、定价、供应商谈判、库存与促销全链路。在 18 个主流模型、各 5 轮评测中,Qwen3.8-Max-Preview 在复购环节展现出持续压价能力,GPT-5.6 Sol 则以 14 倍资产增值领跑。

来源:千问大模型
9月6日 周日

微软推出 MAI-Image-2.6-Flash:生图速度达 GPT-Image-2 的 2.8 倍

微软近日通过 Microsoft Foundry 开放 MAI-Image-2.6-Flash 公开预览,面向高吞吐生产负载。官方称其生成速度达 GPT-Image-2-Medium 的 2.8 倍、GPU 效率提升 72%,保持旗舰级画质,支持多图参考编辑与动态宽高比,最高输出 1.5K 分辨率。

来源:微软AI官方博客

谷歌 DeepMind 发布 WeatherNext 3:每小时刷新、5 公里分辨率全球预报

谷歌 DeepMind 近日发布 WeatherNext 3,号称迄今最精准的全球天气 AI 模型。它直接吸收实时卫星观测、每小时生成全球预报,将温湿度等地面变量分辨率提至 5 公里(较上代 25 公里网格清晰约 5 倍),已接入谷歌搜索、地图与 Gemini。

来源:Google 官方博客

匿名模型 Omen Alpha 上线 OpenCode,线索指向智谱 GLM 系列

继 Ox Alpha 确认为智谱 GLM-5.3-Flash 后,新模型 Omen Alpha 近日上线 OpenCode Go,多方线索指向其同样来自智谱,但厂商尚未正式认领。该模型延续匿名 Alpha 路径,参数与能力未公开,社区据接口特征推断其定位。

来源:IT之家
9月5日 周六

英伟达开源 PAIR:本地 AI 跨设备调度新方案

英伟达以开源测试版发布本地 AI 调度工具 NVIDIA PAIR(Personal AI Router),可在局域网内为本地 AI 请求自动选择空闲的 Mac 或 RTX PC 执行推理,类似把任务分派给空闲工位的调度员,缓解单设备算力瓶颈,面向开发者与小型团队的本地化部署场景。

来源:IT之家

谷歌 Lyria 3.5 登陆 Gemini:一键生成 3 分钟完整歌曲

谷歌于9月5日宣布在 Gemini 应用与 Gemini API 中上线音乐生成模型 Lyria 3.5,支持一键生成最长3分钟的完整歌曲,标志其音乐AI从内部实验工具 Flow Music 走向主流用户与开发者生态。该模型继承 Lyria 3 系列多模态生成能力,面向歌词创作与人声合成场景。

来源:IT之家
9月4日 周五

微软推出最强语音转写模型 MAI-Transcribe-2

微软推出最强 AI 语音转写模型 MAI-Transcribe-2,在 60 种语言的 FLEURS 测试中平均词错误率仅 5.2%,准确率与速度均领先同类语音转写模型,支持说话人分离、逐词时间戳与 verbatim/clean 双模式,已在 Microsoft Foundry、OpenRouter 开放调用。

来源:IT之家

英伟达约130亿美元收购开源AI平台 Hugging Face

英伟达宣布以约129.3亿美元收购全球最大开源AI平台 Hugging Face,交易含119亿美元股东付款与最高10亿美元员工股权激励。Hugging Face 目前汇聚超1800万名开发者、托管300余万个开源模型,收购后将继续保持开放定位、不强制绑定英伟达算力。这笔交易标志着英伟达从芯片层向「算力+模型分发+开发者生态」全栈延伸,是近年全球AI基础设施领域规模最大的收购之一。

来源:财联社

OpenAI 推出最新旗舰大模型 GPT-6 Astra

OpenAI 推出 GPT-6 Astra,官方称其为迄今最智能、对齐程度最高的旗舰大模型,首次达到关键级网络安全门槛,可自主发现并修复未知漏洞,在计算机操作、软件工程与科研任务上刷新多项纪录。

来源:IT之家
9月3日 周四

谷歌推出推理与编码模型 Gemini 3.8

谷歌正式推出 Gemini 3.8 系列,包含通用推理与编码模型 Gemini 3.8 Flash,以及专注漏洞发现与自动补丁修复的 Gemini 3.8 Flash Cyber。3.8 Flash 在长程软件工程基准 DeepSWE v1.1 上得分 71.0%,较 3.7 Flash 的 65.3% 明显提升,并在多项编码基准上超越 GPT-5.6 Sol;API 价格维持每百万 Token 输入 0.75 美元、输出 3.75 美元不变,Flash Cyber 通过 Fairwind Program 向可信防御方开放。

来源:AI工具箱

Meta 推出新一代大语言模型 Muse Spark 1.3

Meta 正式发布新一代大语言模型 Muse Spark 1.3,专注长程智能体与编码场景。新版本在编码基准上超越 GPT-5.6 Sol、与 Claude Fable 5.1 持平,支持 1M tokens 上下文窗口,工具调用较前代减少约 20%、Token 消耗降低约 25%,API 维持输入 1.25 美元 / 输出 4.25 美元每百万 tokens 的定价。

来源:AI工具箱

腾讯混元开源 Hy4 preview 轻量版

腾讯混元正式推出 Hy4 preview 轻量版 并开源,通过自研 Sherry 稀疏三值量化与 MIX-STQ1_0 混合精度策略,将模型权重从约 1.5 TB 压缩至 214 GB(体积减少约 86%),在主流任务上表现接近 BF16 原版。轻量版已上线 Hugging Face 与 GitHub,支持 llama.cpp、vLLM 等框架,可在消费级硬件联合推理部署,为端侧量化场景提供新选择(同类参考 Hy-MT2)。

来源:腾讯混元

阿里云 Qwen 3.8-Max 发布 0902 版本,编程与多步推理登顶

阿里云千问团队发布 Qwen 3.8-Max 的 0902 版本,针对编程与专业办公场景做了强化后训练。新版本在 CodeArena 前端编程总榜以 1691 分登顶,多步推理、工具调用与端到端 App 生成能力刷新全球上限,每百万 Tokens 调用成本仅 5 美元。

来源:阿里云

阿里云「万有无界」企业级 Agent 协作平台开启公测

阿里云推出企业级 Agent 协作平台 万有无界 并开启公测,底层可调用旗舰模型 Qwen 3.8-Max 等。平台将复杂任务拆给多位不同职责的 Agent,通过项目空间、群聊协作与资产库推进工作,内置「小万」个人助理与「小有」项目经理两个主 Agent,覆盖影视、制造等多行业场景。

来源:阿里云

Kimi API 已原生支持 Codex 和 Claude Code

Kimi 开放平台宣布 API 功能更新,原生支持 Codex 与 Claude Code 接入。Kimi API 现已兼容 OpenAI Responses API 格式与 Anthropic Messages API 格式,用户无需格式转换或本地代理,可直连 Kimi K3、Kimi K2.7 Code 等模型。

来源:Kimi开放平台
9月2日 周三

Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1两款模型

Anthropic 推出 Claude Fable 5.1 与 Claude Mythos 5.1 模型,定位“全球最先进的编程与知识工作模型”。Claude Fable 5.1 面向所有用户,Claude Mythos 5.1 仅限审核机构使用。性能方面,Claude Fable 5.1 在 Terminal-Bench-Science、CursorBench 等多项基准测试中超越前代及 GPT-5.6 Sol。

来源:IT之家

李飞飞 World Labs 推出全球首个多模态世界模型 Atlas

李飞飞旗下 World Labs 推出全球首个多模态世界模型 Atlas,采用多模态自回归扩散 Transformer 架构,支持像素级相机控制生成图像与视频、3D 场景重建及时空模拟。Atlas 在相机控制生成和 3D 重建任务中均超越现有 SOTA 模型,被视为机器人 Real-to-Sim 的关键一步,目前正向部分合作伙伴开放早期访问。

来源:量子位

Meta 推出首个实时音频感知模型 Muse Voice Transcribe

Meta 推出首个实时音频感知模型 Muse Voice Transcribe,整合流式语音识别、说话人分离与端点检测,支持 20 余人分轨转写及 70 余种语言。模型采用自适应延迟机制,兼顾实时响应与识别准确度,在 Artificial Analysis 流式语音转文本排行榜位列第一。

来源:IT之家
9月1日 周二

腾讯开源通用多模态 Embedding 模型 WeMM-Embedding

腾讯微信视觉团队开源的通用多模态 Embedding 模型 WeMM-Embedding 提供 2B/4B/9B 三档,支持文本、图像、视频、视觉文档及交错多模态输入统一编码,在 MMEB-v2 基准排行榜位列第一。模型基于 Qwen3.5 架构,采用两阶段训练与 Matryoshka 灵活维度输出。

来源:AI工具箱

小红书 FireRed 推出通用音频语言模型 FireRedAudio

小红书 FireRed 团队推出的通用音频语言模型 FireRedAudio 基于 9B 参数 Qwen3.5 架构,采用解耦连续表征设计,同时支持 ASR、音频问答、长音频理解、Zero-shot TTS、指令 TTS 与语音编辑六大任务。模型在 MMAU、MMSU、102 语种 ASR 及 Instruct TTS 等评测中均取得领先,FLEURS-102 平均错误率仅 14.94%。

来源:AI工具箱

DeepSeek-V4-Flash-Vision-Exp 模型正式开源

DeepSeek 于 2026年8月31日在 Hugging Face 以 MIT 协议开源 V4 系列首个多模态模型 DeepSeek-V4-Flash-Vision-Exp(此前已于 8月21日上线 DeepSeek API 平台)。模型原生支持图片输入,可完成图像描述、文字识别与图表分析,兼容 JPEG/PNG/GIF/WebP 四种格式。在视觉 Agent 基准中,其多模态 Agent 能力已接近 Claude Opus 4.8,纯文本任务则与 V4-Flash 正式版持平。

来源:IT之家
8月31日 周一

Loopit 开源实时交互视频世界模型 Zing-0.5

Zing-0.5 是 Loopit 开源的实时交互视频世界模型,参数规模 5B,基座采用 Wan2.2-TI2V-5B,以 Apache 2.0 协议开放代码与权重。模型支持键盘操控与自然语言语义改写的联合控制,单卡 RTX 5090 实时生成超 24 FPS,一分钟流式推理成本约 6 分钱,在 WBench 实时世界模型评测中位列第一。

来源:GitHub(Loopit 官方仓库)

蚂蚁百灵推出首个金融增强模型 Ling-3.0-flash-Fin

Ling-3.0-flash-Fin 是蚂蚁百灵推出的首个金融增强模型,延续 Ling-3.0-flash 的 124B 总参数 / 5.1B 激活参数 MoE 架构,面向真实金融工作流,强化信息检索、研究推理、估值建模与研报撰写四大能力,在 FinFIRST、FinSearchComp Verified 等金融智能体基准上表现优异。

来源:百灵大模型
8月30日 周日

OpenAI 宣布终止与 Cursor 合作,11月12日起切断模型访问

OpenAI 因 SpaceX 收购后的合规顾虑,宣布将于 11 月 12 日起终止向 Cursor 提供模型访问,称无法确信其遵守服务条款;Cursor 回应 OpenAI 模型承载其约 5% 流量,正与对方沟通解决。

来源:OpenAI

索尼、华纳等唱片公司起诉 Anthropic,指控非法抓取版权作品训练 Claude

索尼音乐、华纳音乐等唱片公司起诉 Anthropic 及其 CEO Dario Amodei,指控其未经许可使用数万首版权音乐作品(主要为歌词)训练 Claude,被称是史上规模最大的知识产权侵权案之一。

来源:The Decoder

Grok Bot 接入 X 平台,付费用户获免费 API 额度

SpaceXAI 将 Grok Bot 接入 X 平台,用户关联账号后可搜索帖子、读取时间线、查看提及并管理书签,付费用户同步获免费 X API 额度;目前仅支持读取,暂不能发帖或回复。

来源:AI工具箱
8月29日 周六

Anthropic 发布 MHS:面向物理设备的 AI 智能体统一控制标准

Anthropic 推出 MHS(Model Hardware Standard),一套让 AI 智能体统一控制显微镜、机械臂等实体设备的标准接口,把 MCP 的”软件工具标准化”思路平移到硬件侧,可将设备集成从数周压缩到小时级。底层能力依托 Claude Opus 4.6 等模型,标准本身保持中立,研究预览期结束后将开源。

来源:IT之家

Midjourney V8.2 上线:图像模型聚焦美学与个性化,新增指令编辑能力

Midjourney V8.2 图像模型已作为默认版本上线,重点提升画面美学、图像质量与个性化理解;配套首款 V8.2 图像编辑模型开放公测,支持文本指令改图、多图参考(最多 4 张)、局部重绘(inpainting)与画布扩展(outpainting),并兼容个性化、情绪板与风格参考。

来源:Midjourney 官方

阿里发布全新 Qoder:从 AI 编程工具升级为智能体工作台

阿里巴巴发布全新 Qoder,以 Coding 为核心底座、面向所有人打造的智能体工作台,用户用自然语言描述目标即可驱动 Agent 完成”读—改—验证—迭代”的长链路任务;内置 Qwen3.8-Max 等模型与 Auto 智能调度,提供编程/通用双模式,累计服务全球超 600 万用户、超 10 万家企业客户。

来源:Qoder 官方
8月28日 周五

腾讯混元新一代旗舰模型 Hy4 preview 上线预览

腾讯混元新一代旗舰模型 Hy4 preview 已开放预览版,采用 770B 总参数与 49B 激活参数的稀疏架构,原生支持 100 万 token 上下文窗口。官方实测显示,端到端推理吞吐较上一代提高 31.8%,在代码编写、办公文档、游戏开发与科研计算四类真实生产力任务中均有明显增益。科研侧进展更受关注:分子动力学模拟效率提升至原先的 2 倍,并把三维 Blaschke-Lebesgue 体积下界这一悬置百年的几何难题推进到 0.41104。

来源:腾讯混元

谷歌发布视频生成模型 Gemini Omni 1.1 Flash,最高 4K 直出

谷歌发布视频生成模型 Gemini Omni 1.1 Flash,最高可直出 4K 成片。它支持从已有片段尾部续写,每次延长 10 秒、单条累计最长 40 秒,只需指定首尾帧即可完成平滑转场与运镜。分辨率覆盖 360p 到 4K 多档,360p 预览模式生成速度快 60%、成本仅三分之一,适合分镜快速迭代;另可挂载最长 3 秒参考视频锁定角色与场景一致性。按秒计费,720p 每秒 0.1 美元、4K 每秒 0.3 美元。

来源:IT之家

阿里通义千问推出海外AI办公平台 QwenWork

QwenWork是阿里通义千问面向海外市场推出的AI办公生产力平台,集成文档处理、表格分析与智能写作等能力,主打多语言协作与企业级工作流自动化。

来源:千问办公QwenWork
8月27日 周四

腾讯混元推出端侧翻译大模型 Hy-MT2-1.8B

腾讯混元最新端侧翻译引擎Hy-MT2的1.8B轻量版利用自研Sherry 1.25-bit量化加2-bit压缩方案,将原3.3GB体积的模型在几乎不损失翻译水准的前提下缩到可端侧部署的体积,实测翻译效果超越微软及豆包等商用接口。该模型与英特尔合作做了x86指令集级算子适配后,已接入B站直播的弹幕实时翻译管线,覆盖33个语种方向,单条弹幕从输入到输出仅耗时500到800毫秒。

来源:腾讯混元

智谱推出原生多模态模型GLM-5.3-Flash

作为GLM-5系列首个原生多模态产品,GLM-5.3-Flash在320B总参数架构下仅激活18B即完成推理。AA基准测试得分57,追平Claude Opus 4.8,而API调用成本仅约后者的2.5%。模型以线性与稀疏双重注意力交替运行削减长序列开销,视觉模块直接编入主干网络,具备自主编写代码、操控浏览器及理解图形界面能力。

来源:智谱

通义千问发布多模态MoE大模型Qwen3.8-Flash

Qwen3.8-Flash是阿里通义基于MoE混合专家架构打造的新模型,125B参数量下每个token仅路由激活6B。上下文窗口原生262K并支持YaRN外推至100万token。底层做了四项革新——GDN与QSA双路注意力、门控残差机制、N-gram词嵌入策略以及Muon训练优化器,把预填充吞吐推到上一代的8.6倍同时把训练花费砍到九分之一。商用API按每百万token计费,输入0.8元输出2.7元。

来源:千问大模型

谷歌推出语音转文本模型 Gemini 3.5 Transcribe

谷歌最新语音转写引擎Gemini 3.5 Transcribe主打”理解式转写”——能自动识别并剔除说话中的”嗯””呃”等语气词以及口误自我更正内容,输出可直接使用的干净文本。与上一代Chirp 3引擎对比,处理速度提高约70%,实时流式场景下词错率压到5.5%以内。模型覆盖85种语言,预录模式支持最多3人同时说话的声纹区分,目前已在Pixel 11手机的Gboard输入法Rambler功能中实装。

来源:IT之家
8月26日 周三

谷歌实验室推出实时协作Vibe Coding工具Play with Putty

Play with Putty是谷歌实验室推出的实时协作工具,主打Vibe Coding体验。用户无需编程基础,通过自然语言描述需求,AI即可自动生成代码并实时渲染为可用工具或网站;支持多人通过链接进入同一共享空间协作,修改即时同步。产品定位轻量消费级实验工具,目前处于排队等候阶段。

来源:AI工具箱

Stability AI 完成 7600 万美元 B 轮融资

Stability AI宣布完成7600万美元(约5.12亿元人民币)B轮融资,投资方包括EA、索尼音乐、环球音乐、华纳音乐及AMD风投部门,资金将用于创意产品开发、应用研究及专业服务扩展。CEO Prem Akkaraju表示投资者将带来专业知识与行业信誉,助力生成式AI赋能创意人士。

来源:IT之家

即梦AI推出影视内容厂牌「即梦片场」

即梦AI正式推出影视内容厂牌「即梦片场」,2026年8月至12月面向影视公司与AI创作者征集电影及剧集项目。电影设S、A两档扶持,剧集设S、A、B三档,提供算力、技术与发行全链路支持,联动番茄小说IP资源。同步推出创作者成长计划,优质作品最高可获10万元现金与百万宣推资源。

来源:即梦AI

爱诗科技推出实时全模态世界模型 PixVerse R2

爱诗科技发布实时全模态世界模型PixVerse R2技术报告。R2在PixVerse R1基础上探索实时世界模型持续Scaling路径,通过Omni Causal AR统一架构支持文本、参考图、音频、动作等多模态输入,实现边生成、边交互、边演化的持续世界运行。模型采用Block-sparse Attention将稀疏度提升至90%以上,Error Bank使长期亮度漂移下降约35.8%。

来源:爱诗科技
8月25日 周二

小红书开源统一语音生成与编辑模型 FireRedTTS3

小红书 FireRed 团队开源统一语音生成与编辑模型FireRedTTS3。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现 24 种语言及 21 种中文方言的零样本音色克隆、自然语言声音设计与指定区域精准语音编辑。模型在四个公开评测集上均取得最优成绩,为有声内容、游戏配音及品牌客服等场景提供高效解决方案。

来源:AI工具箱

RunningHub 首发上线阿里视频生成模型 Wan3.0:单次最长30秒,PPT一键转视频

RunningHub首发完成对阿里视频生成模型Wan3.0的全栈适配——单次生成最长 30 秒视频,支持文本、图片、音频、视频及 doc/ppt/pdf 等文档格式输入,可一键把 PPT 转成教学或营销视频。人物与场景一致性显著提升,RunningHub 旗下 rhTV、RHSTORY、ComfyUI 等生态已同步适配,覆盖影视、广告、电商等商用场景,用户无需本地部署即可按量调用。

来源:AI工具箱

LiblibAI 推出海外AI视频创作平台 Newtake:接入 Seedance 2.5,月付 $19 起

LiblibAI 面向海外市场推出 AI 视频创作平台Newtake,定位「导演工具」。平台基于无限画布与节点工作流,集成导演控制台、电影感灯光、多视角解析及纹理角色表等功能,通过角色一致性管理解决 AI 视频「变脸」痛点,已接入 Seedance 2.5、MiniMax H3 等模型。订阅月付 $19 起,免费用户每日登录可领 100 积分。

来源:AI工具箱
8月24日 周一

字节跳动整合AI生产力:TRAE、扣子并入豆包体系,本周内将推统一办公品牌”豆包工作”

字节跳动被曝完成AI生产力团队整合:TRAE Work、扣子桌面端(Coze)与豆包大模型的工作场景能力合并,转为豆包品牌下产品线,统一向豆包产品负责人汇报;豆包大模型团队支持新业务。最快本周内将推出独立AI办公产品”豆包工作”作为字节AI办公统一品牌,整合后现有用户权益不受影响。

来源:IT之家

阿里通义万相视频大模型 Wan3.0 正式上线:单次生成30秒视频,首创支持办公文档直接转视频

阿里通义万相视频大模型Wan3.0正式上线,单次生成时长从此前的10秒级别跃升至30秒,并首创支持doc、xls、ppt、pdf、md等文档格式直接转视频——PPT上传就能变教学课件。模型落地短剧、影视、广告、文旅、音乐MV等场景;API按秒计费,480P/720P/1080P分别0.3/0.6/1.2元/秒,相比可灵3.0订阅制有更清晰的成本可控性。

来源:阿里云

中国电信天翼AI推出桌面级通用智能体助手TeleAgent

中国电信天翼AI于2026年8月21日正式推出桌面级通用智能体助手TeleAgent(星辰超级智能体),定位”AI办公搭子”,支持Windows 10(64位)及以上与macOS 13及以上系统。与普通AI”问一句答一句”不同,TeleAgent以”任务交付”为核心——自动完成文件整理、深度调研、文档写审、应用生成四大办公场景,用户下达指令即可获得直接可用的成果,默认”先列方案再执行”兼顾自动化与可控性,本地驻留+不强制上传的策略适合财务、商业机密等敏感场景。

来源:中国电信天翼AI
8月23日 周日

蚂蚁百灵开源Ling-3.0基座模型:6个训练节点权重全开放

蚂蚁百灵正式开源 Ling-3.0-tiny-base(总参7.9B/激活1.3B)与 Ling-3.0-flash-base(总参124B/激活5.1B)两个基座模型,并同步开放预训练、中期训练与WSM合并共6个训练节点权重,全部采用MIT许可证。官方基准显示tiny-base在HumanEval-Plus取得 79.27,领先Qwen3.5-9B-base的52.44;配套推理版Ling-3.0-tiny已上线OpenRouter。

来源:蚂蚁百灵inclusionAI

商汤开源SenseNova U1.5-8B-MoT正式版:Apache 2.0许可证

商汤科技开源原生统一多模态大模型 SenseNova U1.5-8B-MoT 正式版,许可证Apache 2.0。模型基于NEO-unify架构,无视觉编码器与VAE,原生支持4K输出、图像编辑与交错图文生成,官方说明其在指令遵循、文字排版、图像编辑等 六个 方面较Preview版全面升级,配套LoRA-8step加速权重同步开源。此前预览版体验可参考SenseNova U1.5-Lite-Preview。

来源:商汤科技SenseTime

Mistral推出Agentic Search:多步检索将复杂文档准确率提升至86%

Mistral AI正式推出Mistral Agentic Search智能体搜索检索层,引入多步检索循环机制,为模型赋予search、open、navigate、read、grep等文档级操作工具。在FinanceBench金融文档基准测试中,基于368份平均约147页的SEC文件,完整agentic循环准确率从单次RAG的27%提升至86%,提升约3倍;p90延迟从255秒降至154秒,token消耗减少最高33.7%。该工具支持云端Studio/Vibe和本地Docker+Vespa部署。

来源:AI工具箱
8月22日 周六

xAI Grok Build 正式全量上线:覆盖网页与移动端,支持一句话生成应用

xAI 的 Grok Build 已结束早期测试,正式向所有套餐用户开放网页端、iOS 与 Android。用户在与 Grok 对话中用自然语言描述需求,即可实时生成并运行应用或小游戏;发布后可获得 grok.me 专属链接、富预览封面,并支持在 X 以互动卡片形式分享与 Remix 二次改造。

来源:AI工具箱

DeepSeek Harness 升级 0.1.1-rc.1,新增视觉模型 V4-Flash-Vision-Exp

DeepSeek 将开源工具链 DeepSeek Harness 升级至 0.1.1-rc.1 版本,在 V4-Flash 与 V4-Pro 基础上新增视觉模型体验版 DeepSeek-V4-Flash-Vision-Exp。前一日发布的 v0.1.0-rc.8 已支持原生图片请求与 /goal、/plan 等指令的图文混合输入,开发者通过 npm 升级即可让 Agent 直接“看图干活”,补全多模态处理闭环。

来源:AI工具箱

Adobe Firefly 音频生成工具全面上线:覆盖音乐、语音与音效

Adobe 的 Adobe Firefly 音频生成工具正式上线,支持在桌面与移动端创作商业安全级别的音乐、语音与音效。调查显示 32.7% 的受访创作者已在视频中使用 AI 生成音乐,43.2% 将法律版权风险视为主要障碍,38.9% 则担心授权费用,Firefly 的商用授权模式试图降低这些顾虑。

来源:AI工具箱
8月21日 周五

OpenAI开源Codex Harness:AI Agent底层执行框架,ARC-AGI-3成绩飙升近3倍

OpenAI开源AI Agent底层执行框架Codex Harness,负责任务理解、工具调用、沙箱执行与人类审批等完整执行循环,支持CLI、SDK与app-server三大接入方式。官方基准显示,仅优化Harness层即可让GPT-5.6 Sol的ARC-AGI-3得分从13.3%跃升至38.3%,Token消耗减少约6倍。

来源:OpenAI

阿里通义发布Qwen-UI-Agent:真机训练的GUI智能体基座,八项基准全面领先

阿里通义推出GUI智能体基座模型Qwen-UI-Agent,基于100多台真机与150多个应用训练,支持GUI与命令行混合执行和100步以上长程任务,在MobileWorld、OSWorld、WebArena等八项基准上全面超越或持平GPT-5.6、Claude Opus等旗舰模型。

来源:通义实验室

DeepSeek Harness重磅更新:多模态支持全面上线,/goal与/plan命令可带图

DeepSeek Harness在发布一周内迎来重大升级,正式加入多模态能力。模型适配器现在可启用原生图片请求,/goal、/plan等指令支持直接带图发送,@引用体验也同步优化。这一更新让智能体在视觉任务中的可用性大幅提升,也被外界解读为DeepSeek V4视觉版可能临近的信号。

来源:AI工具箱

MiniMax Design发布:基于H3多模态视频模型,自然语言即可指挥创作

MiniMax推出商业内容生产平台MiniMax Design,基于MiniMax H3原生多模态视频模型,将视频创作从”操作像素”推进到”操作语义”阶段。用户只需用自然语言描述意图,系统即可自动拆解任务并调用模型完成生成,目标是把前沿模型能力直接转化为商业视频生产力。

来源:AI工具箱

Meta推出Mac版AI助手:支持屏幕共享与跨应用语音输入

Meta正式发布Mac版Meta AI助手桌面应用,支持共享屏幕窗口后由AI基于画面内容提供建议、问答与生成,同时支持跨应用语音输入。此举意在将AI聊天机器人升级为生产力助手,与Google Gemini、ChatGPT和Claude的桌面布局展开正面竞争。

来源:AI工具箱
8月20日 周四

Anthropic延长Claude Code额度50%加成至8月31日,探索永久标准方案

Anthropic宣布将AI编程助手Claude Code每周使用额度50%临时加成从原定8月19日截止延长至2026年8月31日,并正探索将其转为订阅配额的永久标准方案。该加成自7月19日起面向Pro、Max、Team及席位制Enterprise用户推出,以应对开发者对Claude Code日益增长的使用需求。Anthropic表示若反馈持续积极,50%额度提升有望成为长期默认配置。

来源:AI工具箱

Anthropic预告Claude Code将整合/design命令,支持编码前先画UI原型

Anthropic产品设计师Nate Parrott于8月18日在X平台预告,Claude Code即将整合全新/design命令,开发者可在写代码前于终端或桌面版中创建交互式设计模型。输入”/design a few options for {feature}”即可生成多个UI方案供选择,将设计探索前置到编码流程中,提升从设计到开发的整体效率。这是Anthropic持续扩展Claude Code生态的又一举措。

来源:IT之家

微信灰度上线AI总结、AI点评、AI修图三大功能

微信iOS版虽未更新版本号,但通过灰度测试悄然上线AI总结、AI点评和AI修图三大功能,覆盖公众号文章总结、朋友圈点评生成和图片智能编辑场景。AI总结可提取公众号文章要点,AI点评为朋友圈内容生成互动评论,AI修图支持图片智能处理。此外Windows/Mac端4.1.13正式版同步新增合并发图和表情动态预览。此前微信已灰度测试原生AI助手小微助手,AI入口持续扩张。

来源:IT之家
8月19日 周三

Stripe被曝超70亿美元收购OpenRouter,后者同步下调GPT-5.6 Sol调用费

支付巨头Stripe被曝将以超70亿美元收购模型路由平台OpenRouter,后者全球用户达800万,B轮估值约13亿美元。几乎同时,GPT-5.6 Sol在OpenRouter的调用费已下调50%,输入降至2.5美元/百万tokens,输出降至15美元/百万tokens。

来源:IT之家

腾讯云落地马来西亚首个云区域,WorkBuddy企业版同步亮相

腾讯云宣布在马来西亚柔佛州设立首个云区域,首期规划3个可用区,并联合当地高校与企业深化AI人才培养。同时,腾讯AI原生办公智能体WorkBuddy企业版也同步亮相,具备超百种办公技能,覆盖消息、文档、表格、邮件与会议等场景。

来源:IT之家

微软Copilot Notebooks扩展支持Markdown等三种文本格式

微软更新Microsoft 365 Copilot生态下的Copilot Notebooks应用,新增支持Markdown、纯文本和富文本三种格式,进一步强化了AI资料整理与分析能力,方便用户在不同格式间切换编辑和沉淀知识。

来源:IT之家
8月18日 周二

微信密集新增AI入口至16个,灰度测试小微助手

微信近期密集上线AI能力,灰度测试原生AI助手小微,新增3个高频场景入口,使微信内AI入口总数达到16个。新增功能包括:公众号常看的号页面新增AI一键文章总结、长按朋友圈文字可唤起AI点评、聊天看图新增AI处理支持美化与信息提取,覆盖从图片识别到转账提醒的全链路场景,被视为微信从工具型应用向AI原生入口升级的关键信号。

来源:AI工具箱

昆仑万维发布Mureka V9.5:AI音乐转向人情味创作

昆仑万维正式发布AI音乐生成模型Mureka V9.5,是V9系列的最新升级版本。相较前代的高音量、高饱和度强刺激路线,新版转向克制、留白、自然的创作风格,重点强化消除机械感与增添人味儿。核心升级在于深化自研MusiCoT音乐思维链框架——不再直接生成音频波形,而是以思维链推理驱动分步合成,使歌曲在结构、过渡与耐听度上明显改善。

来源:AI工具箱
8月17日 周一

Stripe 超 70 亿美元收购 OpenRouter

彭博社称支付巨头 Stripe 已敲定对 AI 模型聚合平台 OpenRouter 的收购,交易金额超过 70 亿美元,约为后者 B 轮 13 亿美元估值的 5 倍以上。OpenRouter 自称平台全球用户达 800 万,可提供逾 400 种模型统一调用入口。

来源:IT之家 / 彭博社
8月15日 周六

腾讯 QQ Bot 接入 DeepSeek Harness,支持单聊与群聊

腾讯 QQ 官方宣布 QQ Bot 机器人接入 DeepSeek Harness 智能体框架及官方插件,接入仅需 3 步,支持单聊和群聊场景下的 AI 智能体能力。DeepSeek Harness 是深度求索推出的智能体开发框架,可帮助开发者快速构建具备工具调用、代码执行等能力的 AI Agent。

来源:IT之家 / 腾讯QQ
8月14日 周五

小红书开源多模态大模型 dots3.note preview

小红书 dots 模型实验室开源 dots3.note preview,为 dots3 系列首个开源版本。模型总参数 280B、激活 16B 的 MoE 架构,支持 512K 超长上下文,原生具备文本、视觉与语音全模态理解能力,针对复杂推理、Agent 任务与多模态感知场景优化。在多项基准测试中可比肩参数数倍的大模型,并在昇腾 Atlas 800A3 / 900A3 上完成 0Day 适配(基于 vLLM-Ascend)。

来源:Hugging Face

MiniMax 开源音乐生成模型 MiniMax-Music3

MiniMax 开源音乐生成大模型 MiniMax-Music3,支持最长 5 分钟歌曲生成并可同时输出歌词。采用 8B 全局模型 + 0.6B 局部模型的分层架构,全局层负责长程语义与段落结构,局部层恢复细粒度声学细节;输出 32kHz 立体声 WAV,可保持主题、节奏、歌声音色与编曲推进,覆盖前奏、主歌、副歌、桥段等完整曲式结构。

来源:IT之家

智谱推出最强编程开源大模型 GLM-5.3

智谱正式发布 GLM-5.3 开源版本,基座未变、通过后训练 Scaling 显著抬高智能上界,已成为当前编程能力最强的开源大模型。在 Terminal Bench 3.0 等多项基准测试中取得开源第一,模型同时涌现出强大网络安全能力,在代码审查与漏洞发现任务中表现突出。智谱联合多家安全团队累计发现 2,436 个漏洞,并启动”开源的盾”生态计划。

来源:智谱
8月13日 周四

谷歌推出主力模型 Gemini 3.7 Flash,主打编程与 Agent

Google 推出 Gemini 3.7 Flash,专为编程与 Agent 场景设计。模型在软件工程、知识工作及网页开发等任务上较上一代大幅提升,上下文窗口扩展至 100 万 token。即日起至 2026 年底首发优惠为原 3.6 Flash 的一半:输入 \$0.75 / 百万 token,输出 \$3.75 / 百万 token。深度集成 Gemini for Workspace,工具调用与多步任务编排能力同步升级。

来源:IT之家

DeepSeek 同日发布 V4-Pro 正式版与开源智能体框架 Harness

DeepSeek 在 8 月 13 日晚同步推出两项重要发布:正式版 DeepSeek-V4-Pro(Agent 能力显著增强,在 Terminal Bench、DeepSWE 等评测集上表现优异,API 原生支持 OpenAI Responses API 格式),以及开源智能体框架 DeepSeek Harness(v0.1 开发者预览,MIT 协议)。Harness 采用”一切皆插件”的 Cordis 架构,模型、工具、会话、UI 均可自由替换,发布半日 GitHub Star 数突破 3 万,对标 OpenAI Codex 与 Anthropic Claude Code。

来源:DeepSeek 官方
8月11日 周二

Lightricks 开源音视频世界模型 LTX-2.5

Lightricks 发布开源权重世界模型 LTX-2.5(22B),支持文本、图像、视频输入生成同步音画。重磅更新包括:全新 Diffusion Video Decoder(改善高速运动场景伪影)、Diffusion Fidelity Rendering(按场景复杂度分配算力)、原生多镜头切换(一次生成连贯分镜)、定制 Gemma 4 12B 文本编码器 + Prompt Enhancer、可选 Duration Predictor(按动作自动决定时长)。官方盲测胜率 67%,超过 Seedance 2.5(65%)与 MiniMax H3(50%)。

来源:LTX 官方

腾讯推出 Windows 桌面美化工具小鹅桌面

腾讯正式上线 Windows 桌面美化与轻量效率工具 小鹅桌面,永久免费、无广告。核心功能:百万级 4K 动态/静态壁纸 + 自动轮播、头像与桌面小组件库、一键整理桌面、内置轻量 AI 对话窗口(支持待办备忘、截止日期识别与简单总结)、本地 + 云端文件搜索。定位”个人美化与日常效率”,与 WorkBuddy 等办公 Agent 错位互补。

来源:腾讯
8月10日 周一

B 站开源零样本语音克隆模型 IndexTTS-2.5

B 站 IndexSpeechTeam 开源零样本多语种 TTS 模型 IndexTTS-2.5(0.8B),支持中文、英文、日文、西班牙文、阿拉伯文五语种的语音克隆与跨语种迁移。重构推理架构后推理速度提升 2.28 倍(RTF 0.2065@4090 bf16),新增 0.5–2.0 倍语速控制、拼音/CMU/假名发音控制、4 路径情感控制(参考音频 / 八维向量 / 文本推断 / 描述文本)。采用 Bilibili Model License 开源,配套 WebUI(7860 端口)与 vLLM 部署方案。

来源:GitHub / IndexTeam
7月12日 周六

月之暗面Kimi正式发布k2模型,具备超强代码和 Agent 能力

月之暗面正式推出基于MoE架构的新一代基础大模型k2,总参数规模达1T,激活参数32B,支持最长128k tokens上下文处理,具备强大的代码生成与智能体(Agent)能力。模型原生支持ToolCalls、JSON/Partial输出及联网功能,但暂不支持视觉输入。定价方面,输入费用为¥1.00/百万tokens,输出¥4.00/百万,缓存命中¥16.00/百万,在多个性能指标上全面领先当前主流开源模型。

来源:AI工具箱

拍我AI(PixVerse)上线多关键帧生成功能,从“片段”迈向“故事性表达”

拍我AI(PixVerse)全新上线“多关键帧生成”功能,支持用户上传最多7张图片,基于首尾帧模式生成最长30秒的视频内容,实现人物动作、场景变化与镜头语言的自然过渡。该功能显著提升了短剧、广告、故事类视频的生成效率,标志着AI视频从静态片段向完整叙事的跃迁。

来源:爱诗科技AIsphere
7月11日 周五

欧盟《通用人工智能行为准则》8月2日实施

欧盟公布最终版《通用人工智能行为准则》,将于8月2日正式生效。该准则聚焦安全、透明与版权保护三大方面,由专家联合多方制定。企业可自愿签署以减轻合规负担,现有模型有2年调整期,新模型为1年。

来源:IT之家

墨刀AI上线”30秒生成原型图”功能

墨刀AI推出全新原型自动生成能力,支持输入文字描述、草图或截图,30秒内即可产出可交付界面。用户可通过多轮对话优化设计,并自动生成产品文档与页面逻辑,面向产品经理和设计师提供零门槛体验。

来源:墨刀

微软发布高性能端侧模型Phi-4-mini-flash-reasoning

微软推出专为端侧优化的AI模型Phi-4-mini-flash-reasoning。该模型在数学与逻辑推理任务上表现突出,推理吞吐量提升10倍,延迟降低至三分之一。现已上线Azure AI Foundry等平台。

来源:IT之家
7月10日 周四

马斯克发布Grok 4,处理学术问题达到博士级别

马斯克旗下xAI发布新一代大模型Grok 4,推理能力较前代提升10倍,在多项基准测试中超越现有模型,达到”博士后水平”。Grok 4支持工具调用、语音交互、多模态任务,并在ARC-AGI等高难度测试中刷新纪录。

来源:机器之心

办公小浣熊·桌面版全新上线!

商汤科技推出”办公小浣熊”桌面版,支持Windows和Mac平台,用户无需浏览器即可一键唤醒AI助手,实现任务拆解、数据分析、图表生成等办公功能。老用户可同步历史内容。

来源:商汤小浣熊

智谱Z.ai推出实验性大模型GLM-Experimental

智谱AI推出全新实验模型GLM-Experimental,主打”AI Presentation”功能,可一键生成网页版PPT,支持多种风格与互动效果。用户只需输入简单Prompt,模型可自动生成内容、设计排版,实现弹幕、动画等高级效果。

来源:AI工具箱

Perplexity推出AI浏览器——Comet

Perplexity发布AI浏览器Comet,主打”从浏览到思考”,整合网页解释、任务执行等功能,成为用户的”思考伙伴”。Comet目前仅向高价订阅用户开放。

来源:AI工具箱

抖音快手前高管创业,上线AI图片工具KIRA

由抖音、TikTok、快手前核心成员创立的AI图片生成工具KIRA正式亮相。产品由ILLA Cloud孵化,支持一键替换/移除背景、修补、画质增强、扩图等操作,并具备AI生成图片能力。创始团队包括曾任抖音 & TikTok研发、快手孵化业务大前端负责人陈龙博,及抖音、快手多项战略项目设计负责人吴晓松。

来源:AI工具箱
© 版权声明

相关文章