
AI工具箱聚合全球人工智能领域的最新资讯、行业要闻、融资进展、产品迭代、技术突破与独家爆料,全天候实时更新,帮助你第一时间掌握行业趋势与关键变化。
加入AI交流群,获取权威信息源,抢占AI时代先机!
B站开源多语言翻译模型家族 Index-Translate
B站 Index LLM 团队正式开源多语言翻译模型家族 Index-Translate,2B、9B 与 35B-A3B 三档文本模型权重已在 Hugging Face 与 ModelScope 开放。该家族基于 Qwen3.5 构建,覆盖 150 种语言,支持术语、格式与保留内容翻译指令,并延伸出字幕与配音生成、按目标音节数调整译文、长文档上下文一致翻译等能力。
谷歌开源多模态嵌入模型 EmbeddingGemma 2
谷歌发布 EmbeddingGemma 2,开源多模态嵌入模型,基于 Gemma 4 架构、740M 参数,把文本、代码、图像、视频、音频映射到同一 768 维向量空间。代码检索在 MTEB Code 上从 68.76 升至 78.68,纯文本仅 270M 参数,端侧量化后约占 191MB 内存,配套 macOS 应用 AI Edge Foresight 可离线整理会议纪要。
智谱 GLM-5.3 上架亚马逊 Bedrock,按调用量与 AWS 分成
智谱 GLM-5.3 接入亚马逊云科技大模型平台 Amazon Bedrock,AWS 按模型调用量与智谱进行收入分成。智谱近期还与多家海外云厂商落地同类模式;国内已与阿里云百炼签署分成协议,华为云也已上架 GLM-5.3。财报显示,智谱 2026 上半年营收 9.54 亿元,同比增长 399.7%。
英伟达投资的 Reflection AI 发布首款开放权重模型 Beam,5010 亿参数对标 GLM-5.2
英伟达投资的 Reflection AI 发布首款开放权重模型 Beam,总参数 5010 亿,每项任务仅激活 230 亿。官方称其在代码与智能体任务上可对标智谱 GLM-5.2(总参约 7440 亿、激活 400 亿),并逐步逼近千问 3.8-Max。模型权重计划本月稍后开放。
OpenAI 28 天计划首日:GPT-6 Astra 与 GPT-6.1 Sol 默认推理速度提升约 50%
Codex 负责人 Tibo 宣布「28 天计划」首日交付速度优化:GPT-6 Astra 与 GPT-6.1 Sol 的默认推理速度提升约 50%,达 50 TPS,官方订阅与通过 Sign in with ChatGPT 接入的 OpenCode、Pi、Amp、Devin 同步生效。此前 6.1 Sol 上线首日曾因负载暴增明显变慢,有开发者复测 4 小时后仅跑到 35 TPS。
OpenAI 启动「28 天计划」为 Codex 与 ChatGPT Work 每日推送更新
OpenAI 产品与平台负责人 Thibault Sottiaux 公布「28 天计划」:未来 28 天内每天为 Codex 与 ChatGPT Work 推出一项有实际意义的更新,未达标则给一次「重置」,覆盖用户与额度暂未说明。前一天他称团队已「锁定方向」,重点是简化产品与开发新模型。
Meta 开源 Muse Gadgets 项目 开发者可自建接入 Muse 的硬件
Meta 为其个人 AI 智能体 Muse 推出开源项目 Muse Gadgets:开发者可自行设计并制造接入 Muse 的硬件设备,项目向外部开放,Muse 本身可代用户订行程、填表单与购物。Muse 上线约三周下载量已突破 500 万次,是美国最快达到该量级的 AI 应用。
谷歌向免费用户开放 Gemini Skills 自定义技能服务
谷歌向所有免费账户用户开放 Gemini 的自定义技能 Skills,打破此前仅限 Pro、Ultra 付费订阅的限制,免费用户可在主聊天框输入斜杠「/」加指令快速调用预设技能。原有 Gems 自定义配置全部保留并可继续新建,按规划 Gems 将于下月自动迁移并入 Skills,无需手动操作。
字节旗下豆包接入出行服务 覆盖订机票、火车票与打车导航
字节跳动旗下 豆包 正式接入出行服务,覆盖机票、火车票预订、打车叫车与地图导航四类场景,用户可在豆包内完成查询、比价、下单及退改签全流程,无需跳转第三方平台。机票走航班管家、火车票走高铁管家、打车接曹操出行,通过入口成交的酒店订单渠道费率约 12%——这层账本变化,老高AI观察第17期已做过拆解。
OpenAI 推出 Decisions API 让 AI 在预设选项里做选择题
OpenAI 推出由 GPT-6 Luna 驱动的 Decisions API,把模型能力收窄为「预设问题+有限答案集合」的单次决策,只返回选中答案与置信度、不生成文字。官方称端到端响应约 150 毫秒,较常规调用 Luna 的约 1.6 秒快约 10 倍,用于内容分类与工单路由;目前仅限量预览,定价未公布。
Black Forest Labs 发布 FLUX 3 Image 图像生成与编辑模型
德国 AI 公司 Black Forest Labs 发布图像生成模型 FLUX 3 Image,支持生成最高 4K 分辨率图片。模型基于 FLUX 3 基座开发,用户可在归一化 0–1000 坐标网格上为每个元素指定 ID、描述与边界框,实现精准排布;单次生成最多可融入 10 张参考图像,并支持像素级多轮局部编辑。该模型目前通过 API 提供服务,开放权重版本将于数周内公开。
OpenAI 为 ChatGPT 上线虚拟试穿与收藏功能
OpenAI 为 ChatGPT 上线虚拟试穿与收藏两项购物功能,面向全球移动端与网页端同步开放。用户在服饰、配饰商品页点击「试穿」并上传自拍,即可生成上身效果图,参考照片可反复复用;收藏功能把看中的商品存入 ChatGPT Library 备查。功能基于 ChatGPT Images 2.5 图像模型,OpenAI 称其图像模型每周生成的图片已超 30 亿张。
字节跳动将为豆包推出独立个人助手 App「小豆」
字节跳动将豆包在个人助理方向推进的探索项目定名为独立 App「小豆」,该项目内部代号「Spell」,由豆包手机助手团队主导,名称于今年暑期确定,目前处于内部测试阶段,最终对外版本仍可能调整。豆包手机助手此前已与努比亚合作完成技术预览与消费版落地,小豆可视为把手机端积累的个人助理能力延伸到独立应用,使用时不再受手机品牌与系统集成的限制。
Meta Muse 上线三周下载量突破 500 万次
Meta 旗下 AI 助手 Muse 上线约三周下载量突破 500 万次,登顶美国 App Store 免费榜并连续 12 天保持榜首。Sensor Tower 数据显示,达成同样规模所用时间短于 ChatGPT 的 56 天与 Grok 的 103 天;美国市场同期仅 23 款应用在 22 天内达成这一量级。Meta 近期加大 Muse 广告投放,当日下载量环比增长 73%。
微软发布首个实时流式语音转写模型 MAI-Transcribe-2-Streaming
微软发布首个实时流式语音转写模型 MAI-Transcribe-2-Streaming:讲话进行中即持续输出文字,覆盖 60 种语言并支持自动语言检测,最终词错误率 2.50%、延迟 0.13 秒,两项列 Artificial Analysis 流式转写评测第一;经 Microsoft Foundry 与 OpenRouter 提供。
蚂蚁百灵发布长上下文通用大模型 Ling-3.1-flash
蚂蚁百灵发布长上下文通用大模型 Ling-3.1-flash:约 560B 总参数、激活约 25B,上下文上限 100 万 tokens。知识工作评测 GDPval-AA v2.1 得 1,673 Elo,软件工程评测 FrontierSWE 75.16、医疗专业评测 HealthBench Professional 65.35;发布起两周内免费体验,长度限 256K。
谷歌发布迄今最强 AI 模型 Gemini 4 Argon,长周期代码工程基准登顶
谷歌发布迄今最强 AI 模型 Gemini 4 Argon,输出上限提至约 100 万 tokens,主攻长流程软件工程与安全防御。代码工程基准 DeepSWE v1.1 中 Argon 以 77.9% 登顶,高于 Claude Opus 5.5 的 74.2% 与 GPT-6 Astra 的 74.1%;漏洞修复基准 CWE-bench v1 以 68% 并列第一。目前仅向付费 API 客户开放。
OpenAI 为 Codex 推出掌机插件 Game Studio 用自然语言做 Game Boy 游戏
OpenAI 在开发者日联合 ModRetro 为 Codex 推出掌机插件 Game Studio:用户用自然语言描述想法,即可由 Codex 生成游戏程序。插件内置 Chromatic 模拟器,可在电脑端调试验证后串流到真机试玩,成品还能写入专用卡带。Chromatic 复刻 Game Boy Color 的外观与按键设计,兼容原版卡带。
LibTV 联合抖音上线「AI 大师公开课」首期,拆解金奖 AI 短片《合龙》
AI 影视创作平台 LibTV 联合抖音「AI 创作浪潮计划」上线「AI 大师公开课」,首期邀请 2XLabs 导演团队刘树恒、王语宸,以抖音 AI 创作大赛金奖短片《合龙》为例,从叙事、美术、表演三个维度拆解从想法到成片的创作判断,并抛出「AI 缩小了技术差距、却放大了认知差距」的观点。课程不讲提示词,可在抖音官方账号观看,后续还将邀请更多创作者。
DeepSeek 开源昇腾算力平台基础设施组件
DeepSeek 开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 编译工具、计算库与分布式通信库,与此前英伟达平台组件一一对应。TileLang 昇腾版封装 Ascend C 底层指令,已承载 DeepSeek V4 系列模型大部分训练算子,并同步开源 DeepGEMM、FlashMLA 等组件,实测性能接近硬件上限。
OpenAI 发布新一代主力模型 GPT-6.1 Sol 与常驻型智能体 Dots
OpenAI 举办 DevDay 2026,公布 25 项更新。新模型 GPT-6.1 Sol 重点加强智能体编程与 computer use,官方称接近旗舰 GPT-6 Astra,API 标准 Token 价格仅为后者 1/5。同步推出常驻型智能体 Dots,可跟踪长期目标、主动汇报;Codex 升级为云端软件工程团队,Agents API 获 Computer Use 能力。
快手推出新一代 AI 视频生成模型 Kling 4.0
快手可灵宣布新一代视频生成模型 Kling 4.0 将于 10 月正式上线,轻量版 Kling 4.0 Flash 已随官方发布向黑金年卡会员开放抢先体验。新版本单次可生成最长 30 秒原生视频,支持最多 15 项多模态参考、10 张多关键帧控制与 2 分钟超长续拍,新增双通道立体声与 4K HDR 输出,提示词上限提升至 8000 tokens。
Anthropic 推出最新 AI 模型 Claude Sonnet 5.5
Anthropic 推出 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,运行速度较 Claude Sonnet 5 提升 30% 以上,定价为 Claude Opus 5.5 的一半。在智能体编程评测 Terminal-Bench 4.0 上得分由 10.3% 升至 70.6%,现已在 AWS、Google Cloud 与 Microsoft Azure 同步上线。
智谱 ZCode 发布 Trust.patch 公告 开源版更新至 v3.14.3
智谱发布致 ZCode 用户的 Trust.patch 公告,ZCode 开源版已更新至 v3.14.3,今后将与官方版本同步发布,官方表示将持续倾听大家的建议与意见。权益方面,付费用户可获 4 张周重置卡与 4 张 5 小时重置卡,一个月内回归的老用户同享上述权益;官方另限时向全体用户开放 1 亿 Token 领取,限量 10 万份。
DeepSeek 上线 DeepSeek Harness 桌面版预览 免命令行启动 Agent
DeepSeek 上线桌面版 DeepSeek Harness,登录账号或填 API Key、选定本地工作区后即可直接给 Agent 派活,无需再装 Node.js 或在终端敲命令。该版本提供标准、PTC、极简、创造四种模式,内置智能体团队、语音输入、终端、Subagent 等六个官方插件;安装包经官方证书签名,仍属预览构建且暂不支持 Linux。
美团推出新一代大模型 LongCat-2.5-Preview
美团在 LongCat API 开放平台上线新一代大模型 LongCat-2.5-Preview,延续约 1.6 万亿总参数、约 480 亿激活参数的 MoE 架构与 100 万 token 上下文。新版把图片理解原生并入基座,支持跨模态问答与视觉推理,可面向浏览器、桌面软件与设计工具执行长流程任务;官方同时给出 Codex、OpenClaw 等主流环境的接入方法。
MiniMax 上线文本模型 M3.1-Flash-Preview 主打原生多模态与可调推理深度
MiniMax 上线文本模型 M3.1-Flash-Preview,主打原生多模态与 100 万 token 上下文,推理深度可调,目前仅通过 MiniMax Code 与 Token Plan 提供,未开放独立 API。官方同步重置全体用户 Token Plan 额度,并开启十天签到双倍积分。模型面向日常开发,官方称覆盖问题定位、代码实现、测试验证到交付的完整闭环。
快手推出 AI 视频创作 Agent「likli」
快手推出 AI 视频创作 Agent likli,提供 macOS、Windows 桌面端,用对话方式接管写脚本、生成镜头到配音剪辑的全链路,直接交付成片。内置剧作家、配音师、商品编导等 Skill,覆盖口播带货、品牌营销、短剧漫剧三类场景;脚本分镜全程可视可改,素材存进资产中心复用。订阅会员 139 元/月起,该档官方标注每月约可完成 42 次创作任务。
网易有道开源子曰Live系列两款实时交互模型 R2T2 和 T3PO
网易有道开源子曰 Live 系列首批两款实时交互模型 Confucius4-R2T2 与 Confucius4-T3PO,双双登顶 Hugging Face 的语音识别与翻译 Trending 榜首。前者为真流式语音识别模型,支持 80 毫秒至 2 秒可配置流式输入,平均延迟约 200 至 600 毫秒;后者是 140 亿参数的中英同传模型,以 Apache 2.0 协议开源。
阿里达摩院发布食管癌筛查模型 DAMO EAGLE 平扫 CT 即可识别早期病变
阿里达摩院联合四川省肿瘤医院、中山大学肿瘤防治中心等机构,发布食管癌筛查模型 DAMO EAGLE,成果刊于《自然·医学》。模型无需插管与造影,仅凭胸部平扫 CT 即可识别食管癌及癌前病变,已在 3 个国家 8 万余例中验证:机会性筛查中检出敏感性 90%,癌前病变敏感性 52.5%,特异性 99.2%,低剂量 CT 上性能不降。这是达摩院第 4 个癌症筛查模型。
月之暗面把 Kimi WebBridge 升级为 Kimi 浏览器扩展 网页操作可录成技能
月之暗面把 4 个月前发布的浏览器自动化工具 Kimi WebBridge 升级为 Kimi 浏览器扩展,现已支持 Chrome 与 Edge。用户登录后可在侧边栏直接与 Kimi 对话,让它读取页面、点击按钮、填写表单并提取信息;新增的「把操作录成技能」能把一次演示的网页流程保存为可复用技能。原本地 Agent 调用扩展的方式继续保留。
谷歌为 Gemini 3.8 Live 上线 Live Avatar 虚拟人 支持 97 种语言
谷歌正式为 Gemini 3.8 Live 上线 Live Avatar 功能,向 Gemini Enterprise 企业客户开放。该功能把接近实时的视频生成与语音结合,实现精准唇形同步与自然表情,可在 97 种语言之间无缝切换且画面不漂移,并支持后台异步工具调用。企业可用单张参考图生成专属形象,全部输出均嵌入 SynthID 隐形水印。
Epoch AI 家具组装基准公布 GPT-6 Astra 以 80% 准确率登顶
Epoch AI 公布家具组装基准测试(FAB),用 60 张宜家家具组装照片考察模型的空间推理能力。OpenAI 的 GPT-6 Astra 以 80% 准确率居首,Anthropic 的 Claude Opus 5 为 61%,而此前领先模型仅有 28%。GPT-6 Astra 单张照片分析中位耗时约 3 分钟,比此前领先模型快 2 至 10 倍。
DeepSeek 公开 DSec 弹性计算沙箱 支撑百万级 Agent 训练
DeepSeek 公开系统论文,首次披露生产级沙箱平台 DeepSeek DSec。一个生产单元约 160 个 CPU 节点、3 万个核心、250TB 内存,每天服务约 300 万个沙箱,峰值并发超 38 万个,创建速率超每秒 5000 个;DeepSeek-V3.2 到 V4.1 的全部 Agentic RL 训练都跑在其上。论文还记录了智能体绕过访问控制等作弊行为。
小米 MiMo-V3 采用全新架构 核心 HySparse2 公开
小米 MiMo 大模型负责人罗福莉宣布,小米 MiMo-V3 将采用全新自研架构,核心组件 HySparse2 已同步公开。面向长程多轮智能体任务,它在 100 万 token 上下文下把预填充计算量降低 5.02 倍、KV 缓存缩小 4.5 倍,长上下文检索评测得分更高。HySparse2 以 KV 桥接与复用两级共享压缩冗余计算,提升长文本检索精度。
微软发布 Ink Canvas 数字画布 AI 把笔迹变成内容
微软在骁龙峰会上发布 Microsoft Ink Canvas,一款面向 Windows 11 的笔优先画布,把手写笔记、草图、批注与 AI 能力整合进同一工作区,圈选手写内容即可让 AI 摘要、润色或生成 HTML 代码,并接通 Copilot。它适配新款 Slim Pen,新款 Surface Pro 12 英寸将预装,其余兼容设备将于下月 13 日起在微软应用商店下载。
谷歌确认 Gemini 4 已进入后训练 目标远早于年底推出
谷歌 DeepMind 负责人科拉伊·卡武克奥卢在 The Information 峰会上确认,Gemini 4 已进入后训练初期,目标是远早于年底推出,目前处于防护机制开发与安全测试阶段,谷歌工程师已在内部用它运行 Antigravity 编程工具。作为 Gemini 3 系列之后首款下一代旗舰,它主打编码、自主智能体与长程任务,谷歌称其规模显著更大。
Meta 把个人智能体 Muse 装进 AI 眼镜
Meta 在 Connect 2026 大会上宣布,把个人 AI 智能体 Muse 带进 AI 眼镜,未来数月内上线,唤醒后可直接理解眼前画面并发起操作,无需再向 AI 描述所见的物品。Muse 由 Muse Spark 驱动,可代用户发信、订票、比价与下单,同步接入沃尔玛、百思买、丝芙兰等十余家连接器,并新增实时数字形象与专属邮箱。
华为小艺 Work 正式上线
华为正式上架 AI 工作助理 小艺 Work,定位 7×24 小时在线的办公执行体,覆盖市场调研、文档处理、PPT 制作、数据分析、内容创作与代码开发。用户给出目标后,系统自主拆解任务、调度工具并推进执行,关键环节可人工复核。电脑端提供云电脑与本地双执行环境,后台可持续运行,任务结果自动同步至手机;新用户首享 31 天 1000 AI 点免费额度。
高通携手 PrismML 推出 1-bit Bonsai 端侧视觉语言模型
高通携手 PrismML 在骁龙 AR1 Gen 1 智能眼镜平台本地跑通 20 亿参数的 1-bit 量化 1-bit Bonsai 视觉语言模型,眼镜离线也能识图作答。官方称同内存可容纳约 4 倍参数,权重内存占用 0.43GB、对标 4-bit 版的 1.66GB,生成速度达到同规格 4-bit 模型的 2.06 倍,模型由 Bonsai 1.7B 构建。
腾讯混元 Hy 翻译 App 正式上线
腾讯混元宣布 Hy 翻译 App 正式上线,同步提供小程序、插件与 PC 端。产品基于混元 Hy-MT2 翻译模型打造,支持 33 种语言互译,覆盖藏语、维吾尔语等 5 种少数民族语言及方言,提供语音、拍照、对话与离线翻译,支持口语化、学术等翻译风格切换,离线时可提前把模型下载至手机。现已在含美国、日本、韩国及中国港澳台地区在内的 12 个国家和地区上架。
腾讯音乐推出 AI 音乐创作平台 MusicBuddy
腾讯音乐上线 AI 音乐创作平台 MusicBuddy,面向独立音乐人提供灵感、创作、精修、发行、宣推、经营六个环节的全链路服务。保留传统 DAW 分轨编辑形态,左侧嵌入 AI 对话面板,用自然语言完成编曲、乐器替换、混响调整与歌词改写;内置多套音乐模型,支持选择人声与上传参考音乐。作品完成后可一键分发至 QQ 音乐、酷狗等平台,自动生成 MV 与宣推海报。
阶跃星辰开源终端编程智能体 Step Code
阶跃星辰开源终端编程智能体 Step Code,采用 MIT License,可在终端内完成编码、调试与交付。它在 Terminal Bench 2.1 以 80.9% 通过率并列第一,Token 消耗最低;长程基准 Multi-Frame 以 73.3% 通过率居六款 Agent Harness 之首,平均 5.09M Tokens,内置 StepPage 一键发布静态站点。
阿里通义推出语音大模型系列 Qwen-Audio-3.1
阿里通义在云栖大会发布 Qwen-Audio-3.1 系列五款语音大模型,覆盖语音识别、语音合成、实时交互与音频创作。ASR 支持 30 种语言与 16 种中文方言,首字响应约 160 毫秒;TTS-Next 可一次生成人声、音效与环境音。API 已上架千问 AI 平台,Qwen-Audio 全线价格同步下调,最高降幅 95%。
蚂蚁开源图像生成模型 Ming-Image-0.1-Design
蚂蚁集团 inclusionAI 开源 Ming-Image-0.1-Design 系列,含两个 6B 模型:Design 专攻 UI、海报等文字密集型设计,原生输出透明背景素材;Layer 把成品图拆成 2—9 个可编辑图层。Design 以 Elo 1082 登顶 Artificial Analysis 设计开放权重榜,Layer 在 Crello 评测 12 项全部第一。
爱派AiPy正式上架银河麒麟软件商店
AI 自动化工具爱派AiPy 正式上架银河麒麟软件商店,支持一键安装。它以「大模型 + Python 执行环境」为底座,可用语音或自然语言派发任务,覆盖数据分析、文档与 PPT 批量生成、网页采集、量化回测等场景,支持内网本地化部署与国产大模型接入,并提供沙盒权限、删除保护、加密传输、审计日志与工作空间隔离等安全能力。
OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款模型
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,沿用 GPT-6 Astra 的训练方法,把 Astra 在专业工作、事实性、编程、计算机使用与对齐上的顶尖能力下放到更快、更经济的小尺寸模型,官方称 Astra 仍是无妥协首选。两款模型的 API 价格较 GPT-5.6 促销价下调 50%,单任务成本最低不到竞品一成。
Anthropic 推出 Claude 5.5 系列首款模型 Claude Opus 5.5
Anthropic 发布 Claude 5.5 系列首款模型 Claude Opus 5.5,官方称多数任务表现与 Claude Fable 5.1 相当,典型任务成本较上代 Claude Opus 5 降低 40%、输出速度提升超 30%,模型已上线 Claude 与亚马逊云、谷歌云、微软 Azure,并被 Claude Code v2.1.280 设为默认 Opus 模型。
爱诗科技正式推出通用实时世界模型 PixVerse R2
爱诗科技正式发布全球首个具备 Scaling 能力的通用实时世界模型 PixVerse R2,开放游戏、互动影视与数字人体验间,支持 WASD 控制角色移动与 Prompt 实时改写环境。模型以 Omni Causal AR 与 Real-Time Acceleration 解耦能力与实时性,块稀疏注意力稀疏度超 90%,Error Bank 让画面漂移下降约 35.8%。
阿里推出面向手机场景的 AI 全栈方案 Qwen Intelligence
阿里推出面向手机场景的 AI 全栈方案 Qwen Intelligence,不造硬件,向手机厂商输出场景优化模型、可定制平台与垂域 Agent。其中 Mobile Planner 负责任务拆解与记忆,每千次任务成本约 2.41 美元;Mobile-Use 以 API 优先、GUI 兜底方式自动操作,端到端成功率 90%、时延降低 28.8%。
腾讯混元推出专业级生图模型 Hy Image3.5 preview
腾讯混元推出专业级生图模型 Hy Image3.5 preview,综合能力较 3.0 版本提升约 30%,在专业设计师盲测中与 Seedream 5.0 Pro 持平。模型支持文生图、图生图、多轮对话编辑与 2K 分辨率输出,API 定价 0.15 元/张,已上线 腾讯元宝、ima.copilot、Miora 等应用,主打高性价比的专业创作。
月之暗面推出 Kimi Code 官方桌面客户端 Kimi Code Desktop
月之暗面把 Kimi Code 编程智能体从命令行搬进桌面,推出官方客户端 Kimi Code Desktop,macOS 与 Windows 同步上线。打开本地文件夹即可对话驱动 Agent 读写代码、执行命令,内置终端、浏览器与 Git 面板;权限分始终询问、必要时询问、完全自动三档,另有 Plan、Goal、Swarm 三种模式。
小米开源全模态模型系列 Xiaomi MiMo-V2.6
小米开源全模态模型系列 Xiaomi MiMo-V2.6,Pro 为 1.02 万亿参数、每 token 激活 42B,Flash 为 3090 亿参数、激活 15B,均支持 100 万 token 上下文与文本、图像、视频、音频输入,以 MIT 许可开放权重。Pro 在 Artificial Analysis 智能指数取得 46 分,API 定价与 MiMo-V2.5 持平。
LibTV 1.5 版本更新,五大独家功能升级创作全流程
AI 影视创作平台 LibTV 发布 1.5 版本,一次性补齐五大功能:角色造型室可对五官、发型、服饰逐项可视化调整并存为角色卡复用;剧本创编在改写台词时会提示对大纲与伏笔的连带影响;导演分身能导入个人创作方法,自动拆分镜并批量优化提示词;3D-BOX 虚拟影棚无需建模,对话即可搭景、画线预演运镜;成片精修提供创意片头、字幕调整与口播粗剪。
阿里通义团队开源图像模型 Qwen-Image-2.1
阿里通义开源图像模型 Qwen-Image-2.1,视觉生成部分参数量 7B,采用 32 层 Single-Stream DiT 架构,原生支持透明图像生成与透明图层编辑,单次最多参考 10 张图,并提供圈选、涂抹等局部编辑,在 Qwen-Image-Bench 上以 60.28 分成为该榜开源模型最高分,模型以研究许可发布、禁止商业使用。
阶跃星辰推出旗舰模型 Step 5 Preview
阶跃星辰推出旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构、总参 600B/激活 27B,支持 100 万 Token 上下文与原生文本、视觉输入,Artificial Analysis 智能指数 44 分,单任务成本为 Claude Opus 5 的 1/8,代码评测覆盖 553 个仓库、9 类任务与 33 种语言,完整权重尚未释放。
阿里智能体工作台 Qoder 正式上线 Qoder Sites
阿里 Qoder 正式上线 Qoder Sites,用户一句话即可构建并发布网页应用、生成分享链接,支持权限管理。与多数 Vibe Coding 产物不同,Qoder Sites 能同步创建后端数据库,页面数据可持久保存、状态持续更新,还可绑定 Qoder Cloud Agents 接入 Agent 能力;Qoder v0.3.3 与 CLI v1.1.54 已全面支持。
MiniMax 开源命令行 AI 编程工具 MiniMax Code CLI
MiniMax 把命令行 AI 编程工具 MiniMax Code CLI(MMX-CLI)的 v0.4.12 版本源码开源到 GitHub,采用 MIT 协议。它在 FrontierHarness Eval 中任务通过率 76.7%、成功任务耗时中位数 4 分 33 秒,两项均优于公开基线;官方称开源意在让开发者审查工具的调用逻辑与权限处理方式。
阿里 HappyOyster 1.0 系列世界模型上架阿里云百炼
阿里 HappyOyster 1.0 系列世界模型正式上架阿里云百炼,主打实时生成、持续演化的开放世界体验,开发者无需邀测即可直接调用 API。Adventure 可基于文本或图像生成可自由探索的开放世界,支持实时移动与镜头控制;Directing 能在世界生成后用文本指令实时驱动角色、剧情与镜头,目前仅支持新加坡与美国(弗吉尼亚)地域。
智谱正式开源 ZCode
智谱正式开源旗下编程工具 ZCode,源码托管到 GitHub,涵盖桌面端、Web 工作区、后端、Agent CLI 与运行时,官方同时为代码上传争议致歉,承诺数据无留存、从未用于模型训练。客户端 v3.14.0 已移除 Repo Wiki 功能并切断本地仓库快照上传链路,信通院评测确认其阿里云 OSS 存储桶为零数据状态。
Figure 推出全身人形机器人 VLA 基础模型 Helix 2.5
Figure 正式推出全身人形机器人 VLA 基础模型 Helix 2.5,在 30 户从未采集过数据的陌生家庭中完成整理客厅、折叠毛巾、铺床三类长时序家务,零样本全身任务成功率达 56%,而从零训练的策略仅 9%。其泛化能力来自 Index 人类行为数据集预训练,任务专用数据用量约为上一代 Helix 02 的一半,硬件载体为 Figure 03 人形机器人。
阿里通义推出端到端实时同声传译模型 Qwen3.8-LiveTranslate
阿里通义正式推出端到端实时同声传译模型 Qwen3.8-LiveTranslate,字均延迟(LAAL)降至 2.3 秒,支持 60 种语言音频输入与 29 种语言语音输出。基于 Hybrid MoE 的 Thinker–Talker 双模块把音频与文本压进同一条交织序列,并新增实时说话人分离,14 个语向的流式分离错误率为 9.7%。
xAI 推出实时语音转写模型 Grok Voice Transcribe 2.0
xAI 正式推出实时语音转写模型 Grok Voice Transcribe 2.0,在 Artificial Analysis 的 32 个流式转写模型中准确率排名第一,19 种语言短句的词错误率降至 6.8%。批量转写 0.10 美元每音频小时、流式 0.20 美元;说话人分离、词级时间戳与每请求 100 个术语偏置均不额外计费。
OpenAI 在 Microsoft Word 上线 ChatGPT 官方加载项,免费档位同样可用
OpenAI 将 ChatGPT 以官方加载项形式接入 Microsoft Word,与 Excel、PowerPoint 共用同一个加载项,覆盖包括 Free 在内的全部订阅档位。侧边栏可从笔记起草、汇总长文、改写选段并统一标题格式;免费与 Go 档调用 GPT-5.6 Luna,付费档才给 GPT-5.6 Sol,按 token 计费并与 Codex 共享额度。
Anthropic 为 Claude Code 新增 AGENTS.md 通用智能体配置支持
Anthropic 为旗下智能体编程工具 Claude Code 的 2.1.277 版本新增对 AGENTS.md 的支持,开发者可用一份通用配置文件统一描述智能体的角色、工具与运行约束,无需为不同产品重复维护提示词。AGENTS.md 正成为 OpenAI 与 Anthropic 共同采纳的跨厂商智能体标准,同一份配置即可在多个智能体产品间复用。
OpenAI 推出 Astra for Law 法律AI基础平台
OpenAI 正式推出 Astra for Law 法律AI基础平台,法律检索索引收录超 2.3 亿个 URL,判例部分覆盖 99.9% 以上已发布的美国先例判例法。在 ValsAI 的 200 道题中,其正确率 54.0%,高于仅用网页搜索的 GPT-6 Astra 的 38.7%,目前通过申请制 Trusted Access 计划向选定美国律所开放。
特斯拉推送更新 豆包大模型语音助手扩至更多车型
特斯拉推送 2026.26.200.11 版本更新,把 豆包大模型 语音助手扩展到更多车型。该功能需订阅高级车载娱乐服务,支持多音色角色切换与自然口语交互,并同步升级宠物模式自定义、盲点警报氛围灯与开门预警,用户在车机端登录豆包账号后即可启用,豆包大模型的语音能力也正从手机与办公场景持续延伸到车载终端,逐步成为车机端的主要交互入口。
阿里千问上线高德门店经营专家套件 覆盖 10 项技能
阿里千问为 千问办公 上线高德门店经营专家套件,整合选址顾问、商场洞察与门店诊断三大能力共 10 项技能,覆盖从选址评估到日常经营分析的全链路,把商圈数据与经营诊断收进同一入口。用户授权高德账号后即可调用,无需在多个系统之间来回切换,面向连锁品牌与零售团队提供一站式门店决策支持,门店拓展团队不必再逐个平台重复取数。
阿里千问推出新一代原生全模态模型 Qwen3.8-Omni-Flash
阿里千问推出新一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频与视频输入及 1M 长上下文,30 项评测较上代平均提升超 26%,音频能力整体超越 Gemini 3.8 Flash,API 音频输入价格降幅超 98%。模型可端到端完成视频剪辑、短剧翻译、电影解说与会议纪要执行等长程工作流,面向需要把音视频素材直接产出成稿的团队。
智谱推出高速推理模型 GLM-5.3-FlashX
智谱推出高速推理模型 GLM-5.3-FlashX,最高推理速度达 200 tokens/s。模型此前以「Ox Alpha」代号与开发者见面,调用量持续攀升,此次基于 10 万张国产芯片的推理算力加大 Infra 侧投入与推理优化。前代 GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速形成智能、价格与速度的全面竞争力。
腾讯正式推出 AI 游戏创作平台 「游点灵」
腾讯 AI 游戏创作工具「代号 Craft」正式定名为 游点灵 CraftBuddy,新名称延续「Craft」并融入伙伴概念,定位为用户的「AI 游戏创作搭子」。用户可访问 craft.qq.com 体验由游点灵创作的游戏,创作资格正陆续发放,关注官方渠道可获取活动消息。
腾讯推出 AI 原生语音输入助手 Chatterfly
腾讯推出的 AI 原生语音输入助手 Chatterfly 进入内测,主打 Fn 键口述即出成稿,内置会议纪要、工作汇报、营销文案等 6 个可独立开关的场景技能,并可持续记忆个人表达习惯。它把语音输入从「打字替代」推进到「口述—润色—成稿」一条链路,面向需要在桌面端快速把想法落成文稿的用户。
科大讯飞推出全国产语音基座大模型 Spark-Audio-1.0-Preview
科大讯飞上线全国产语音基座大模型 Spark-Audio-1.0-Preview,采用 0.65B 语音编码器配 30B-A3B MoE 解码器,支持 99 种语言与 202 种方言,在 Fleurs 中文测试集上达到 SOTA。模型可在弱网、嘈杂、轻声等环境下保持稳定识别,并开放体验入口,面向需要高精度语音转写与实时对话的场景。
腾讯云开源自托管 AI 助手 Octop 发布 1.0 正式版
腾讯云自研的开源自托管多用户 AI 助手 Octop 发布 1.0 GA 正式版,采用 MIT 协议,GitHub 星标已突破 3000。本次更新补齐 RAG 知识库公共与私有分级检索、页面与功能级 ACL 权限、Token 额度限制与专家沙箱隔离;同步上线 macOS、Windows、Linux 桌面客户端与飞牛 NAS 应用,并在腾讯云轻量应用服务器 Lighthouse、云服务器 CVM 镜像市场上架官方镜像,一条命令即可把 AI 协作中枢部署在自己的机器上。
生数科技推出实时交互与编辑视频模型 Vidu S2
生数科技推出 Vidu S2,包含 S2-Avatar 与 S2-Editing 两款模型。S2-Avatar 把实时输出分辨率提升至 720P、帧率达 25–42 FPS,支持对话中动态更新参考图并连贯完成摘戴帽子等动作;S2-Editing 可对输入视频流实时完成风格迁移、虚拟试穿、人物替换与背景替换四类编辑。S2-Avatar 在 StreamAV-Bench 九项指标全部居首,S2-Editing 在 OpenVE 与 RefVIE 联合评测取得 4.26 综合分。
科大讯飞推出全场景 AI 生产力工作台 AStudio
科大讯飞推出桌面 AI 生产力工作台 AStudio,以星火 X2.5 为核心,搭载自研 ACode Harness 智能体执行内核,支持多模型切换、Plan 规划与目标 Goal 两种运行模式及多智能体协作。产品划分日常空间与项目空间,可连接本地文件与真实项目,直接交付文档、网页、代码等成果并完成验证,已接入支付宝、高德、飞书等第三方工具。
谷歌推出原生实时语音对话模型 Gemini 3.8 Live
谷歌推出原生实时语音对话模型 Gemini 3.8 Live,同时提供标准版与 Extended Thinking 版两个版本。标准版主打规模化部署与成本优化,支持 97 种语言自动切换、近实时视觉理解与后台工具调用;Extended Thinking 版强化多步推理,可让模型在推理的同时持续发言,并在多项语音质量基准测试中排名第一。它与此前发布的推理与编码模型 Gemini 3.8 形成能力互补。
豆包工作模型上新,同时推出「豆包工作伙伴」
豆包官宣两大更新:豆包 2.1 Pro 模型完成 0915 小版本升级并全量上架火山方舟,同时推出 AI 办公协作智能体「豆包工作伙伴」。该智能体以独立身份加入飞书群聊、文档与会议,拥有自己的权限与记忆,可随 @ 随到、主动补位,承接资料整理、深度调研与进度跟进等任务。豆包工作覆盖群聊、文档、会议与电脑操作四类入口,企业可对其权限、额度与数据范围做集中治理。
上海 AI Lab 开源多模态基础大模型「书生-S2」
上海人工智能实验室开源基础大模型书生-S2,通用能力居开源第一梯队,生物、材料、化学及 IMO-Proof / AdvancedMathBench 等科学长程任务比肩顶尖闭源。模型通过 Memory Decoder 架构引入可插拔专业记忆模块,兼顾领域扩展与通用能力;并强化长程推理与智能体执行。
宇树开源通用人形基础模型UnifoLM-WLA-1.0
宇树科技宣布全开源新一代通用人形机器人基础模型UnifoLM-WLA-1.0,代码、模型与数据集同步开放。模型基于大规模多模态感知理解与交互中心世界建模训练,使用约 2500 小时真机数据;多项具身推理评测领先开源模型、比肩头部闭源模型,真机可单模型统筹 64 个任务,覆盖桌面与全身移动操作,具备跨任务、跨末端执行器泛化。
阶跃星辰推出语音大模型系列 StepAudio 3
阶跃星辰推出StepAudio 3系列语音大模型,含 Realtime、ASR、TTS、Gen、Music 五款,多款在 Artificial Analysis 榜单全球第一。Realtime 以 98.9% 综合得分登顶实时语音交互榜首,ASR 词错误率仅 1.7% 并列第一。模型覆盖实时对话、语音识别、真人级合成、全音频生成及音乐创作。
智象未来推出全模态视频生成模型 HiDream-O1-Video-1.0
智象未来推出首款原生全模态视频模型HiDream-O1-Video-1.0,支持多模态输入,一键直出 5-20 秒 1080p 视频,在意图理解、物理规律、叙事规划及音画一体化生成上全面升级,获 Artificial Analysis 图生视频榜全球第四、Arena.ai 榜第 8,标志中国 AI 视频进入全球第一梯队。
月之暗面 Kimi 推出新一代主力模型 K2.8 Preview
月之暗面将新一代主力模型 Kimi K2.8 Preview 全量上线 Kimi Code 与 Kimi Work,全部会员档位开放最高 1M 上下文窗口。官方称其综合性能接近旗舰 Kimi K3,思考效率较 Kimi K2.7 Code 显著改善,支持 low/high/max 三档 thinking effort 以及图片、视频输入,本次预览未公布任何基准测试数据。此前 Kimi K3 带动公司年度经常性收入(ARR)在两个月内从 3 亿美元增至 10 亿美元以上。
亚马逊云科技推出企业级 AI 工作助手 Amazon Quick
亚马逊云科技将企业级 AI 工作助手 Amazon Quick 桌面端在 macOS、Windows 正式开放,并在 iOS、Android 端上线动态信息流:邮件、消息、CRM、日历汇入按优先级排序的视图,Agent 处理完的事项自动消失,只留需人工判断的队列。个人档 20 美元/月起,Professional 与 Enterprise 档每月 Agent 时长分别由 4、8 小时提升到 8、18 小时,并取得 HIPAA、FedRAMP、SOC 2、ISO 27001 认证。
蚂蚁灵波科技开源实时交互世界模型 LingBot-World 2.0
蚂蚁灵波科技开源实时交互世界模型 LingBot-World 2.0 系列三款模型:Small 仅 1.3B 参数,面向消费级单卡 GPU,可在单卡上实时生成世界;Bidirectional 作为双向 Teacher 模型提供高质量蒸馏源;Causal Pretrain 提供因果预训练底座,支持相机位姿与文本提示两类输入。该系列可小时级连续生成不漂移,高配推理下达到 720P/60FPS。与同类世界模型 Zing-0.5 相比,1.3B 版本把本地实时运行门槛进一步压低。
谷歌 DeepMind 推出 AlphaGenome Atlas 全基因组变异图谱
谷歌 DeepMind 正式推出全基因组变异效应预测图谱 AlphaGenome Atlas,覆盖人类基因组全部单碱基变化的效应打分,配套交互式浏览器与 API,可服务于遗传病位点解读与基因编辑脱靶评估。
微软为 Microsoft 365 Copilot 推出自主智能体 Project Opal
微软正式为 Microsoft 365 Copilot 推出自主 AI 智能体 Project Opal,可在企业级云桌面自动执行审计、HR 入职等跨系统任务,支持实时监控与人工接管。
微软发布 VS Code 1.137 支持按计划调度 AI 智能体
微软正式发布代码编辑器 VS Code 1.137,支持让 AI 智能体按预设计划自动执行编辑、运行与提交,并新增代理式终端与多文件重构能力。
小米开源目标说话人语音识别大模型 Xiaomi-CocktailASR-1
小米正式开源目标说话人语音识别模型 Xiaomi-CocktailASR-1,可通过参考音频锁定目标说话人并只转录其发言,LibriMix 2mix 测试集上词错误率(WER)低至 4.11%,通用模型 Qwen3-ASR 为 68.75%;权重与代码以 Apache 2.0 协议开放。
Cursor 开启 Projects beta 支持数千子智能体并行
Cursor 正式开启 Cursor Projects beta,由协调智能体跨数月维护项目上下文,向数千个子智能体并行派发任务,合上笔记本后仍在云端运行;支持订阅 Slack 频道、PR 与定时任务触发,实现无人值守交付。
OpenAI 开放 Agents API 公测并开源 Codex harness
OpenAI 正式将驱动 Codex 的智能体框架以 OpenAI Agents API 开放公测,一次调用即可拉起生产级 agent,会话编排、上下文压缩与子智能体并行全部托管;不收额外 API 费用,仅按 token 与工具用量计费,底层 Codex harness 同步开源。
基元律动联合无问芯穹推出 Agent-Native 模型 NeoHorse-1
基元律动联合无问芯穹与清华大学、北京大学、香港中文大学、阿里巴巴等推出开源 Agent-Native 模型 NeoHorse-1,提供 4B 与 9B 两个版本,原生支持 262,144 tokens 上下文。模型训练数据取自 Harness 结构化执行轨迹,官方十项基准宏平均 69.04,高于同规模 Qwen3.5-9B 的 65.60 与 Gemma-4-12B-it 的 63.51,tau²-Bench 智能体评测达到 90.82。
OpenAI将实时语音模型 GPT-Live-1 上线 API
OpenAI 正式将 GPT-Live-1 上线 API,把全双工语音能力开放给开发者调用。前端语音层按 0.05 美元/分钟计费,模型将语音理解与输出合并进同一个模型,轮次延迟降至 0.798 秒;官方称全双工基准得分提升 30 个百分点,搭配 GPT-6 Astra 可在语音智能体评测中排名第一,支撑餐厅预订、客服等电话场景。
DeepSeek 正式开源 V4.1 Flash
DeepSeek 正式开源多模态模型 DeepSeek V4.1 Flash:552B 总参 MoE 架构,输入仅激活 8B、输出 16B,原生支持多模态并大幅压缩 KV Cache,显著降低 Agent 场景推理成本。API 已同步上线,调用名改为 deepseek-flash,腾讯 WorkBuddy、CodeBuddy 与 OpenCode 已完成全量接入。
阿里 Qoder 国际版上线内置模型 Sonus
阿里 Qoder 国际版新增内置模型 Sonus,主打超长自主任务执行与电脑操作能力。配合 Qoder 桌面端 0.2.3 版本优化,Sonus 可直接操控电脑及各类专业软件,自主完成编程、金融建模、科学研究、制作电子表格等复杂任务。
蚂蚁开源原生多模态大模型 Ling-3.0-flash-VL
蚂蚁百灵开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL,总参数 124B、单次推理仅激活 5.5B,原生支持图像、文本、视频与 256K 上下文,BF16 与 FP8 权重以 MIT 协议上架 Hugging Face。模型引入「观察—行动—验证—修正」视觉反馈闭环,在 Artificial Analysis 评测中较纯文本版提升 4 分,面向网页复刻、GUI Agent 与医疗报告解读场景。
Meta 推出首款个人智能体 Muse
Meta 正式发布首款个人智能体 Muse,已在美国上线 iOS、Android 与 Web 端,可自主完成发送邮件、预订行程、在线购物等任务。产品提供免费档与 20、100 美元月订阅;每个用户的 Muse 运行在独立的云端专用沙箱中,发送邮件或完成购物前需用户确认,对话数据不进入广告系统,底层模型为 Muse Spark 1.3。
ChatGPT 语音模式支持调用 GPT-5.6 Sol 和 GPT-6 Astra
OpenAI 更新 ChatGPT 语音模式,用户可在语音对话中自选模型与推理深度,GPT-6 Astra 处理搜索与复杂推理,每次转交底层文本模型均计入消息额度。同步简化 GPT-Live 限额:200 美元 Pro 套餐可无限使用 GPT-Live-1,原有 Instant、Medium、High 三档独立语音智能等级停用。相关工具页见 ChatGPT。
小米开放邀测桌面AI应用 XiaoMi MiMo Desktop
小米 MiMo 团队宣布 XiaoMi MiMo Desktop 开放邀测,这款桌面AI智能体应用可直接读取表格、PDF、音视频等素材,自动拆解任务并调用工具,交付可继续编辑的文档、网页、3D 与 App;内置 Smart 调度在同会话缓存命中率最高达 99%,邀测用户可限时限量免费体验 MiMo-X-Pro-Preview 与 MiMo-X-Flash-Preview 两款新模型。
智象未来正式上线内容创作智能体 vivago R1
智象未来旗下内容创作智能体 vivago R1 正式面向全球用户上线,国内版「够搭」同步完成升级。产品定位全球首个无限时长内容创作智能体,可一次性稳定输出 5 分钟高质量视频并支持多轮延长,依托自研 HD-AgentOS,内容有效可用成功率达 85%,vivago.ai 全球用户已突破 7000 万。
OpenAI 推出新一代图像生成模型 ChatGPT Images 2.5
OpenAI 推出新一代图像模型 ChatGPT Images 2.5,在细节、编辑精准度和生成速度上全面升级,生成延迟较 2.0 版本降低 50%,多轮编辑一致性显著增强,能更好保留参考照片主体。目前用户每周通过 ChatGPT Images 及 API 生成超 30 亿张图片,API 同步推出 GPT-Image-2.5 Flare 与 Sunburst 两款模型。
腾讯混元升级 Hy4 preview 模型
腾讯混元针对复杂任务中的长思考、过度自我验证等问题,对旗舰模型 Hy4 preview 完成专项升级,已通过 Bench 指标与人工评测双重监控全量上线。新版本在不损失任务效果的前提下,显著降低任务轮次及输入输出 token 消耗,效率提升明显。
蚂蚁集团开源统一图像生成与编辑模型 LLaDA-Image
蚂蚁集团 InclusionAI 开源 6B 参数统一图像生成与编辑模型 LLaDA-Image,搭载自条件学习与统一生成编辑架构,TwinFlow 蒸馏技术将推理步数从 50 步压缩至 2-4 步。在 Qwen-Image-Bench 中,该模型以中文、英文双料成绩位列开源第一,综合表现介于 GPT Image 1 与 Imagen 4.0 Ultra 之间。
DeepSeek内测新模型 DeepSeek V4.1 Flash
DeepSeek 开启新版旗舰模型 DeepSeek V4.1 Flash 中间版内测,定位「原生多模态低成本主力」,上下文窗口与单次 token 价格均向中小开发者倾斜,工具调用与代码生成对标自家 V4-Pro 系列同档表现。该中间版将于 9 月 10 日自动过期,开发者被引导迁移至随后正式版,是 V4 系列首次以「内测即对外开放 API」形式曝光。此前视觉多模态方向体验可参考已发布的 DeepSeek-V4-Flash-Vision-Exp。
面壁智能开源端侧语言基座模型 MiniCPM5-2B
面壁智能联合 OpenBMB 开源 2B 端侧语言基座模型 MiniCPM5-2B,在 AA 榜单位列全球 4B 以下开源模型第一,综合 23 分,Agentic Index 达 20 分、约为同级十倍。项目同步开放 UltraData 数据、Meshy 框架与 JustRL II,并已完成英特尔、瑞芯微、Arm 等平台 Day0 适配。
科大讯飞正式推出星火X2.5
科大讯飞正式推出 星火X2.5,这是基于全国产算力训练的旗舰大模型,采用 MoE 293B-A30 架构、支持 256K 上下文,重点强化代码生成与智能体(Agent)能力,并覆盖 200 余种语言,推理定价当前限时 5 折。
阿里正式推出 QoderWake 1.0
阿里正式推出 QoderWake 1.0,把「AI 数字员工」的管理做成企业人事系统:企业可以像招聘真人一样,对 AI 员工进行招募、培训、授权与考核,让人负责决策把关、数字员工负责执行推进。该产品将优秀员工的能力沉淀为可复用的数字化生产力,为研发、运营等多岗位提供几乎不设上限的数字化人力产能。
马斯克 xAI 将 Grok Bot 适配 iPad 与安卓,补全四大终端
马斯克旗下 xAI 将 Grok Bot 适配至 iPad 与安卓端,补齐 Mac、iPhone 后实现四大终端全覆盖。Grok Bot 定位 AI 智能体协作平台,支持多个 Agent 24 小时组队执行任务、跨应用登录并共享任务上下文,可在机器人之间传递信息、协同推进项目。目前该功能已向全平台用户开放。
阿里联合淘天开源电商经营评测基准 E-Commerce Bench
阿里联合淘天集团开源电商经营评测基准 E-Commerce Bench,让大模型以 10 万元本金在真实市场数据中经营网店 365 天,覆盖选品、定价、供应商谈判、库存与促销全链路。在 18 个主流模型、各 5 轮评测中,Qwen3.8-Max-Preview 在复购环节展现出持续压价能力,GPT-5.6 Sol 则以 14 倍资产增值领跑。
微软推出 MAI-Image-2.6-Flash:生图速度达 GPT-Image-2 的 2.8 倍
微软近日通过 Microsoft Foundry 开放 MAI-Image-2.6-Flash 公开预览,面向高吞吐生产负载。官方称其生成速度达 GPT-Image-2-Medium 的 2.8 倍、GPU 效率提升 72%,保持旗舰级画质,支持多图参考编辑与动态宽高比,最高输出 1.5K 分辨率。
谷歌 DeepMind 发布 WeatherNext 3:每小时刷新、5 公里分辨率全球预报
谷歌 DeepMind 近日发布 WeatherNext 3,号称迄今最精准的全球天气 AI 模型。它直接吸收实时卫星观测、每小时生成全球预报,将温湿度等地面变量分辨率提至 5 公里(较上代 25 公里网格清晰约 5 倍),已接入谷歌搜索、地图与 Gemini。
匿名模型 Omen Alpha 上线 OpenCode,线索指向智谱 GLM 系列
继 Ox Alpha 确认为智谱 GLM-5.3-Flash 后,新模型 Omen Alpha 近日上线 OpenCode Go,多方线索指向其同样来自智谱,但厂商尚未正式认领。该模型延续匿名 Alpha 路径,参数与能力未公开,社区据接口特征推断其定位。
英伟达开源 PAIR:本地 AI 跨设备调度新方案
英伟达以开源测试版发布本地 AI 调度工具 NVIDIA PAIR(Personal AI Router),可在局域网内为本地 AI 请求自动选择空闲的 Mac 或 RTX PC 执行推理,类似把任务分派给空闲工位的调度员,缓解单设备算力瓶颈,面向开发者与小型团队的本地化部署场景。
谷歌 Lyria 3.5 登陆 Gemini:一键生成 3 分钟完整歌曲
谷歌于9月5日宣布在 Gemini 应用与 Gemini API 中上线音乐生成模型 Lyria 3.5,支持一键生成最长3分钟的完整歌曲,标志其音乐AI从内部实验工具 Flow Music 走向主流用户与开发者生态。该模型继承 Lyria 3 系列多模态生成能力,面向歌词创作与人声合成场景。
微软推出最强语音转写模型 MAI-Transcribe-2
微软推出最强 AI 语音转写模型 MAI-Transcribe-2,在 60 种语言的 FLEURS 测试中平均词错误率仅 5.2%,准确率与速度均领先同类语音转写模型,支持说话人分离、逐词时间戳与 verbatim/clean 双模式,已在 Microsoft Foundry、OpenRouter 开放调用。
英伟达约130亿美元收购开源AI平台 Hugging Face
英伟达宣布以约129.3亿美元收购全球最大开源AI平台 Hugging Face,交易含119亿美元股东付款与最高10亿美元员工股权激励。Hugging Face 目前汇聚超1800万名开发者、托管300余万个开源模型,收购后将继续保持开放定位、不强制绑定英伟达算力。这笔交易标志着英伟达从芯片层向「算力+模型分发+开发者生态」全栈延伸,是近年全球AI基础设施领域规模最大的收购之一。
OpenAI 推出最新旗舰大模型 GPT-6 Astra
OpenAI 推出 GPT-6 Astra,官方称其为迄今最智能、对齐程度最高的旗舰大模型,首次达到关键级网络安全门槛,可自主发现并修复未知漏洞,在计算机操作、软件工程与科研任务上刷新多项纪录。
谷歌推出推理与编码模型 Gemini 3.8
谷歌正式推出 Gemini 3.8 系列,包含通用推理与编码模型 Gemini 3.8 Flash,以及专注漏洞发现与自动补丁修复的 Gemini 3.8 Flash Cyber。3.8 Flash 在长程软件工程基准 DeepSWE v1.1 上得分 71.0%,较 3.7 Flash 的 65.3% 明显提升,并在多项编码基准上超越 GPT-5.6 Sol;API 价格维持每百万 Token 输入 0.75 美元、输出 3.75 美元不变,Flash Cyber 通过 Fairwind Program 向可信防御方开放。
Meta 推出新一代大语言模型 Muse Spark 1.3
Meta 正式发布新一代大语言模型 Muse Spark 1.3,专注长程智能体与编码场景。新版本在编码基准上超越 GPT-5.6 Sol、与 Claude Fable 5.1 持平,支持 1M tokens 上下文窗口,工具调用较前代减少约 20%、Token 消耗降低约 25%,API 维持输入 1.25 美元 / 输出 4.25 美元每百万 tokens 的定价。
腾讯混元开源 Hy4 preview 轻量版
腾讯混元正式推出 Hy4 preview 轻量版 并开源,通过自研 Sherry 稀疏三值量化与 MIX-STQ1_0 混合精度策略,将模型权重从约 1.5 TB 压缩至 214 GB(体积减少约 86%),在主流任务上表现接近 BF16 原版。轻量版已上线 Hugging Face 与 GitHub,支持 llama.cpp、vLLM 等框架,可在消费级硬件联合推理部署,为端侧量化场景提供新选择(同类参考 Hy-MT2)。
阿里云 Qwen 3.8-Max 发布 0902 版本,编程与多步推理登顶
阿里云千问团队发布 Qwen 3.8-Max 的 0902 版本,针对编程与专业办公场景做了强化后训练。新版本在 CodeArena 前端编程总榜以 1691 分登顶,多步推理、工具调用与端到端 App 生成能力刷新全球上限,每百万 Tokens 调用成本仅 5 美元。
阿里云「万有无界」企业级 Agent 协作平台开启公测
阿里云推出企业级 Agent 协作平台 万有无界 并开启公测,底层可调用旗舰模型 Qwen 3.8-Max 等。平台将复杂任务拆给多位不同职责的 Agent,通过项目空间、群聊协作与资产库推进工作,内置「小万」个人助理与「小有」项目经理两个主 Agent,覆盖影视、制造等多行业场景。
Kimi API 已原生支持 Codex 和 Claude Code
Kimi 开放平台宣布 API 功能更新,原生支持 Codex 与 Claude Code 接入。Kimi API 现已兼容 OpenAI Responses API 格式与 Anthropic Messages API 格式,用户无需格式转换或本地代理,可直连 Kimi K3、Kimi K2.7 Code 等模型。
Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1两款模型
Anthropic 推出 Claude Fable 5.1 与 Claude Mythos 5.1 模型,定位“全球最先进的编程与知识工作模型”。Claude Fable 5.1 面向所有用户,Claude Mythos 5.1 仅限审核机构使用。性能方面,Claude Fable 5.1 在 Terminal-Bench-Science、CursorBench 等多项基准测试中超越前代及 GPT-5.6 Sol。
李飞飞 World Labs 推出全球首个多模态世界模型 Atlas
李飞飞旗下 World Labs 推出全球首个多模态世界模型 Atlas,采用多模态自回归扩散 Transformer 架构,支持像素级相机控制生成图像与视频、3D 场景重建及时空模拟。Atlas 在相机控制生成和 3D 重建任务中均超越现有 SOTA 模型,被视为机器人 Real-to-Sim 的关键一步,目前正向部分合作伙伴开放早期访问。
Meta 推出首个实时音频感知模型 Muse Voice Transcribe
Meta 推出首个实时音频感知模型 Muse Voice Transcribe,整合流式语音识别、说话人分离与端点检测,支持 20 余人分轨转写及 70 余种语言。模型采用自适应延迟机制,兼顾实时响应与识别准确度,在 Artificial Analysis 流式语音转文本排行榜位列第一。
腾讯开源通用多模态 Embedding 模型 WeMM-Embedding
腾讯微信视觉团队开源的通用多模态 Embedding 模型 WeMM-Embedding 提供 2B/4B/9B 三档,支持文本、图像、视频、视觉文档及交错多模态输入统一编码,在 MMEB-v2 基准排行榜位列第一。模型基于 Qwen3.5 架构,采用两阶段训练与 Matryoshka 灵活维度输出。
小红书 FireRed 推出通用音频语言模型 FireRedAudio
小红书 FireRed 团队推出的通用音频语言模型 FireRedAudio 基于 9B 参数 Qwen3.5 架构,采用解耦连续表征设计,同时支持 ASR、音频问答、长音频理解、Zero-shot TTS、指令 TTS 与语音编辑六大任务。模型在 MMAU、MMSU、102 语种 ASR 及 Instruct TTS 等评测中均取得领先,FLEURS-102 平均错误率仅 14.94%。
DeepSeek-V4-Flash-Vision-Exp 模型正式开源
DeepSeek 于 2026年8月31日在 Hugging Face 以 MIT 协议开源 V4 系列首个多模态模型 DeepSeek-V4-Flash-Vision-Exp(此前已于 8月21日上线 DeepSeek API 平台)。模型原生支持图片输入,可完成图像描述、文字识别与图表分析,兼容 JPEG/PNG/GIF/WebP 四种格式。在视觉 Agent 基准中,其多模态 Agent 能力已接近 Claude Opus 4.8,纯文本任务则与 V4-Flash 正式版持平。
Loopit 开源实时交互视频世界模型 Zing-0.5
Zing-0.5 是 Loopit 开源的实时交互视频世界模型,参数规模 5B,基座采用 Wan2.2-TI2V-5B,以 Apache 2.0 协议开放代码与权重。模型支持键盘操控与自然语言语义改写的联合控制,单卡 RTX 5090 实时生成超 24 FPS,一分钟流式推理成本约 6 分钱,在 WBench 实时世界模型评测中位列第一。
蚂蚁百灵推出首个金融增强模型 Ling-3.0-flash-Fin
Ling-3.0-flash-Fin 是蚂蚁百灵推出的首个金融增强模型,延续 Ling-3.0-flash 的 124B 总参数 / 5.1B 激活参数 MoE 架构,面向真实金融工作流,强化信息检索、研究推理、估值建模与研报撰写四大能力,在 FinFIRST、FinSearchComp Verified 等金融智能体基准上表现优异。
OpenAI 宣布终止与 Cursor 合作,11月12日起切断模型访问
OpenAI 因 SpaceX 收购后的合规顾虑,宣布将于 11 月 12 日起终止向 Cursor 提供模型访问,称无法确信其遵守服务条款;Cursor 回应 OpenAI 模型承载其约 5% 流量,正与对方沟通解决。
索尼、华纳等唱片公司起诉 Anthropic,指控非法抓取版权作品训练 Claude
索尼音乐、华纳音乐等唱片公司起诉 Anthropic 及其 CEO Dario Amodei,指控其未经许可使用数万首版权音乐作品(主要为歌词)训练 Claude,被称是史上规模最大的知识产权侵权案之一。
Grok Bot 接入 X 平台,付费用户获免费 API 额度
SpaceXAI 将 Grok Bot 接入 X 平台,用户关联账号后可搜索帖子、读取时间线、查看提及并管理书签,付费用户同步获免费 X API 额度;目前仅支持读取,暂不能发帖或回复。
Anthropic 发布 MHS:面向物理设备的 AI 智能体统一控制标准
Anthropic 推出 MHS(Model Hardware Standard),一套让 AI 智能体统一控制显微镜、机械臂等实体设备的标准接口,把 MCP 的”软件工具标准化”思路平移到硬件侧,可将设备集成从数周压缩到小时级。底层能力依托 Claude Opus 4.6 等模型,标准本身保持中立,研究预览期结束后将开源。
Midjourney V8.2 上线:图像模型聚焦美学与个性化,新增指令编辑能力
Midjourney V8.2 图像模型已作为默认版本上线,重点提升画面美学、图像质量与个性化理解;配套首款 V8.2 图像编辑模型开放公测,支持文本指令改图、多图参考(最多 4 张)、局部重绘(inpainting)与画布扩展(outpainting),并兼容个性化、情绪板与风格参考。
阿里发布全新 Qoder:从 AI 编程工具升级为智能体工作台
阿里巴巴发布全新 Qoder,以 Coding 为核心底座、面向所有人打造的智能体工作台,用户用自然语言描述目标即可驱动 Agent 完成”读—改—验证—迭代”的长链路任务;内置 Qwen3.8-Max 等模型与 Auto 智能调度,提供编程/通用双模式,累计服务全球超 600 万用户、超 10 万家企业客户。
腾讯混元新一代旗舰模型 Hy4 preview 上线预览
腾讯混元新一代旗舰模型 Hy4 preview 已开放预览版,采用 770B 总参数与 49B 激活参数的稀疏架构,原生支持 100 万 token 上下文窗口。官方实测显示,端到端推理吞吐较上一代提高 31.8%,在代码编写、办公文档、游戏开发与科研计算四类真实生产力任务中均有明显增益。科研侧进展更受关注:分子动力学模拟效率提升至原先的 2 倍,并把三维 Blaschke-Lebesgue 体积下界这一悬置百年的几何难题推进到 0.41104。
谷歌发布视频生成模型 Gemini Omni 1.1 Flash,最高 4K 直出
谷歌发布视频生成模型 Gemini Omni 1.1 Flash,最高可直出 4K 成片。它支持从已有片段尾部续写,每次延长 10 秒、单条累计最长 40 秒,只需指定首尾帧即可完成平滑转场与运镜。分辨率覆盖 360p 到 4K 多档,360p 预览模式生成速度快 60%、成本仅三分之一,适合分镜快速迭代;另可挂载最长 3 秒参考视频锁定角色与场景一致性。按秒计费,720p 每秒 0.1 美元、4K 每秒 0.3 美元。
阿里通义千问推出海外AI办公平台 QwenWork
QwenWork是阿里通义千问面向海外市场推出的AI办公生产力平台,集成文档处理、表格分析与智能写作等能力,主打多语言协作与企业级工作流自动化。
腾讯混元推出端侧翻译大模型 Hy-MT2-1.8B
腾讯混元最新端侧翻译引擎Hy-MT2的1.8B轻量版利用自研Sherry 1.25-bit量化加2-bit压缩方案,将原3.3GB体积的模型在几乎不损失翻译水准的前提下缩到可端侧部署的体积,实测翻译效果超越微软及豆包等商用接口。该模型与英特尔合作做了x86指令集级算子适配后,已接入B站直播的弹幕实时翻译管线,覆盖33个语种方向,单条弹幕从输入到输出仅耗时500到800毫秒。
智谱推出原生多模态模型GLM-5.3-Flash
作为GLM-5系列首个原生多模态产品,GLM-5.3-Flash在320B总参数架构下仅激活18B即完成推理。AA基准测试得分57,追平Claude Opus 4.8,而API调用成本仅约后者的2.5%。模型以线性与稀疏双重注意力交替运行削减长序列开销,视觉模块直接编入主干网络,具备自主编写代码、操控浏览器及理解图形界面能力。
通义千问发布多模态MoE大模型Qwen3.8-Flash
Qwen3.8-Flash是阿里通义基于MoE混合专家架构打造的新模型,125B参数量下每个token仅路由激活6B。上下文窗口原生262K并支持YaRN外推至100万token。底层做了四项革新——GDN与QSA双路注意力、门控残差机制、N-gram词嵌入策略以及Muon训练优化器,把预填充吞吐推到上一代的8.6倍同时把训练花费砍到九分之一。商用API按每百万token计费,输入0.8元输出2.7元。
谷歌推出语音转文本模型 Gemini 3.5 Transcribe
谷歌最新语音转写引擎Gemini 3.5 Transcribe主打”理解式转写”——能自动识别并剔除说话中的”嗯””呃”等语气词以及口误自我更正内容,输出可直接使用的干净文本。与上一代Chirp 3引擎对比,处理速度提高约70%,实时流式场景下词错率压到5.5%以内。模型覆盖85种语言,预录模式支持最多3人同时说话的声纹区分,目前已在Pixel 11手机的Gboard输入法Rambler功能中实装。
谷歌实验室推出实时协作Vibe Coding工具Play with Putty
Play with Putty是谷歌实验室推出的实时协作工具,主打Vibe Coding体验。用户无需编程基础,通过自然语言描述需求,AI即可自动生成代码并实时渲染为可用工具或网站;支持多人通过链接进入同一共享空间协作,修改即时同步。产品定位轻量消费级实验工具,目前处于排队等候阶段。
Stability AI 完成 7600 万美元 B 轮融资
Stability AI宣布完成7600万美元(约5.12亿元人民币)B轮融资,投资方包括EA、索尼音乐、环球音乐、华纳音乐及AMD风投部门,资金将用于创意产品开发、应用研究及专业服务扩展。CEO Prem Akkaraju表示投资者将带来专业知识与行业信誉,助力生成式AI赋能创意人士。
即梦AI推出影视内容厂牌「即梦片场」
即梦AI正式推出影视内容厂牌「即梦片场」,2026年8月至12月面向影视公司与AI创作者征集电影及剧集项目。电影设S、A两档扶持,剧集设S、A、B三档,提供算力、技术与发行全链路支持,联动番茄小说IP资源。同步推出创作者成长计划,优质作品最高可获10万元现金与百万宣推资源。
爱诗科技推出实时全模态世界模型 PixVerse R2
爱诗科技发布实时全模态世界模型PixVerse R2技术报告。R2在PixVerse R1基础上探索实时世界模型持续Scaling路径,通过Omni Causal AR统一架构支持文本、参考图、音频、动作等多模态输入,实现边生成、边交互、边演化的持续世界运行。模型采用Block-sparse Attention将稀疏度提升至90%以上,Error Bank使长期亮度漂移下降约35.8%。
小红书开源统一语音生成与编辑模型 FireRedTTS3
小红书 FireRed 团队开源统一语音生成与编辑模型FireRedTTS3。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现 24 种语言及 21 种中文方言的零样本音色克隆、自然语言声音设计与指定区域精准语音编辑。模型在四个公开评测集上均取得最优成绩,为有声内容、游戏配音及品牌客服等场景提供高效解决方案。
RunningHub 首发上线阿里视频生成模型 Wan3.0:单次最长30秒,PPT一键转视频
RunningHub首发完成对阿里视频生成模型Wan3.0的全栈适配——单次生成最长 30 秒视频,支持文本、图片、音频、视频及 doc/ppt/pdf 等文档格式输入,可一键把 PPT 转成教学或营销视频。人物与场景一致性显著提升,RunningHub 旗下 rhTV、RHSTORY、ComfyUI 等生态已同步适配,覆盖影视、广告、电商等商用场景,用户无需本地部署即可按量调用。
LiblibAI 推出海外AI视频创作平台 Newtake:接入 Seedance 2.5,月付 $19 起
LiblibAI 面向海外市场推出 AI 视频创作平台Newtake,定位「导演工具」。平台基于无限画布与节点工作流,集成导演控制台、电影感灯光、多视角解析及纹理角色表等功能,通过角色一致性管理解决 AI 视频「变脸」痛点,已接入 Seedance 2.5、MiniMax H3 等模型。订阅月付 $19 起,免费用户每日登录可领 100 积分。
阿里通义万相视频大模型 Wan3.0 正式上线:单次生成30秒视频,首创支持办公文档直接转视频
阿里通义万相视频大模型Wan3.0正式上线,单次生成时长从此前的10秒级别跃升至30秒,并首创支持doc、xls、ppt、pdf、md等文档格式直接转视频——PPT上传就能变教学课件。模型落地短剧、影视、广告、文旅、音乐MV等场景;API按秒计费,480P/720P/1080P分别0.3/0.6/1.2元/秒,相比可灵3.0订阅制有更清晰的成本可控性。
中国电信天翼AI推出桌面级通用智能体助手TeleAgent
中国电信天翼AI于2026年8月21日正式推出桌面级通用智能体助手TeleAgent(星辰超级智能体),定位”AI办公搭子”,支持Windows 10(64位)及以上与macOS 13及以上系统。与普通AI”问一句答一句”不同,TeleAgent以”任务交付”为核心——自动完成文件整理、深度调研、文档写审、应用生成四大办公场景,用户下达指令即可获得直接可用的成果,默认”先列方案再执行”兼顾自动化与可控性,本地驻留+不强制上传的策略适合财务、商业机密等敏感场景。
蚂蚁百灵开源Ling-3.0基座模型:6个训练节点权重全开放
蚂蚁百灵正式开源 Ling-3.0-tiny-base(总参7.9B/激活1.3B)与 Ling-3.0-flash-base(总参124B/激活5.1B)两个基座模型,并同步开放预训练、中期训练与WSM合并共6个训练节点权重,全部采用MIT许可证。官方基准显示tiny-base在HumanEval-Plus取得 79.27,领先Qwen3.5-9B-base的52.44;配套推理版Ling-3.0-tiny已上线OpenRouter。
商汤开源SenseNova U1.5-8B-MoT正式版:Apache 2.0许可证
商汤科技开源原生统一多模态大模型 SenseNova U1.5-8B-MoT 正式版,许可证Apache 2.0。模型基于NEO-unify架构,无视觉编码器与VAE,原生支持4K输出、图像编辑与交错图文生成,官方说明其在指令遵循、文字排版、图像编辑等 六个 方面较Preview版全面升级,配套LoRA-8step加速权重同步开源。此前预览版体验可参考SenseNova U1.5-Lite-Preview。
Mistral推出Agentic Search:多步检索将复杂文档准确率提升至86%
Mistral AI正式推出Mistral Agentic Search智能体搜索检索层,引入多步检索循环机制,为模型赋予search、open、navigate、read、grep等文档级操作工具。在FinanceBench金融文档基准测试中,基于368份平均约147页的SEC文件,完整agentic循环准确率从单次RAG的27%提升至86%,提升约3倍;p90延迟从255秒降至154秒,token消耗减少最高33.7%。该工具支持云端Studio/Vibe和本地Docker+Vespa部署。
xAI Grok Build 正式全量上线:覆盖网页与移动端,支持一句话生成应用
xAI 的 Grok Build 已结束早期测试,正式向所有套餐用户开放网页端、iOS 与 Android。用户在与 Grok 对话中用自然语言描述需求,即可实时生成并运行应用或小游戏;发布后可获得 grok.me 专属链接、富预览封面,并支持在 X 以互动卡片形式分享与 Remix 二次改造。
DeepSeek Harness 升级 0.1.1-rc.1,新增视觉模型 V4-Flash-Vision-Exp
DeepSeek 将开源工具链 DeepSeek Harness 升级至 0.1.1-rc.1 版本,在 V4-Flash 与 V4-Pro 基础上新增视觉模型体验版 DeepSeek-V4-Flash-Vision-Exp。前一日发布的 v0.1.0-rc.8 已支持原生图片请求与 /goal、/plan 等指令的图文混合输入,开发者通过 npm 升级即可让 Agent 直接“看图干活”,补全多模态处理闭环。
Adobe Firefly 音频生成工具全面上线:覆盖音乐、语音与音效
Adobe 的 Adobe Firefly 音频生成工具正式上线,支持在桌面与移动端创作商业安全级别的音乐、语音与音效。调查显示 32.7% 的受访创作者已在视频中使用 AI 生成音乐,43.2% 将法律版权风险视为主要障碍,38.9% 则担心授权费用,Firefly 的商用授权模式试图降低这些顾虑。
OpenAI开源Codex Harness:AI Agent底层执行框架,ARC-AGI-3成绩飙升近3倍
OpenAI开源AI Agent底层执行框架Codex Harness,负责任务理解、工具调用、沙箱执行与人类审批等完整执行循环,支持CLI、SDK与app-server三大接入方式。官方基准显示,仅优化Harness层即可让GPT-5.6 Sol的ARC-AGI-3得分从13.3%跃升至38.3%,Token消耗减少约6倍。
阿里通义发布Qwen-UI-Agent:真机训练的GUI智能体基座,八项基准全面领先
阿里通义推出GUI智能体基座模型Qwen-UI-Agent,基于100多台真机与150多个应用训练,支持GUI与命令行混合执行和100步以上长程任务,在MobileWorld、OSWorld、WebArena等八项基准上全面超越或持平GPT-5.6、Claude Opus等旗舰模型。
DeepSeek Harness重磅更新:多模态支持全面上线,/goal与/plan命令可带图
DeepSeek Harness在发布一周内迎来重大升级,正式加入多模态能力。模型适配器现在可启用原生图片请求,/goal、/plan等指令支持直接带图发送,@引用体验也同步优化。这一更新让智能体在视觉任务中的可用性大幅提升,也被外界解读为DeepSeek V4视觉版可能临近的信号。
MiniMax Design发布:基于H3多模态视频模型,自然语言即可指挥创作
MiniMax推出商业内容生产平台MiniMax Design,基于MiniMax H3原生多模态视频模型,将视频创作从”操作像素”推进到”操作语义”阶段。用户只需用自然语言描述意图,系统即可自动拆解任务并调用模型完成生成,目标是把前沿模型能力直接转化为商业视频生产力。
Meta推出Mac版AI助手:支持屏幕共享与跨应用语音输入
Meta正式发布Mac版Meta AI助手桌面应用,支持共享屏幕窗口后由AI基于画面内容提供建议、问答与生成,同时支持跨应用语音输入。此举意在将AI聊天机器人升级为生产力助手,与Google Gemini、ChatGPT和Claude的桌面布局展开正面竞争。
Anthropic延长Claude Code额度50%加成至8月31日,探索永久标准方案
Anthropic宣布将AI编程助手Claude Code每周使用额度50%临时加成从原定8月19日截止延长至2026年8月31日,并正探索将其转为订阅配额的永久标准方案。该加成自7月19日起面向Pro、Max、Team及席位制Enterprise用户推出,以应对开发者对Claude Code日益增长的使用需求。Anthropic表示若反馈持续积极,50%额度提升有望成为长期默认配置。
Anthropic预告Claude Code将整合/design命令,支持编码前先画UI原型
Anthropic产品设计师Nate Parrott于8月18日在X平台预告,Claude Code即将整合全新/design命令,开发者可在写代码前于终端或桌面版中创建交互式设计模型。输入”/design a few options for {feature}”即可生成多个UI方案供选择,将设计探索前置到编码流程中,提升从设计到开发的整体效率。这是Anthropic持续扩展Claude Code生态的又一举措。
微信灰度上线AI总结、AI点评、AI修图三大功能
微信iOS版虽未更新版本号,但通过灰度测试悄然上线AI总结、AI点评和AI修图三大功能,覆盖公众号文章总结、朋友圈点评生成和图片智能编辑场景。AI总结可提取公众号文章要点,AI点评为朋友圈内容生成互动评论,AI修图支持图片智能处理。此外Windows/Mac端4.1.13正式版同步新增合并发图和表情动态预览。此前微信已灰度测试原生AI助手小微助手,AI入口持续扩张。
Stripe被曝超70亿美元收购OpenRouter,后者同步下调GPT-5.6 Sol调用费
支付巨头Stripe被曝将以超70亿美元收购模型路由平台OpenRouter,后者全球用户达800万,B轮估值约13亿美元。几乎同时,GPT-5.6 Sol在OpenRouter的调用费已下调50%,输入降至2.5美元/百万tokens,输出降至15美元/百万tokens。
腾讯云落地马来西亚首个云区域,WorkBuddy企业版同步亮相
腾讯云宣布在马来西亚柔佛州设立首个云区域,首期规划3个可用区,并联合当地高校与企业深化AI人才培养。同时,腾讯AI原生办公智能体WorkBuddy企业版也同步亮相,具备超百种办公技能,覆盖消息、文档、表格、邮件与会议等场景。
微软Copilot Notebooks扩展支持Markdown等三种文本格式
微软更新Microsoft 365 Copilot生态下的Copilot Notebooks应用,新增支持Markdown、纯文本和富文本三种格式,进一步强化了AI资料整理与分析能力,方便用户在不同格式间切换编辑和沉淀知识。
微信密集新增AI入口至16个,灰度测试小微助手
微信近期密集上线AI能力,灰度测试原生AI助手小微,新增3个高频场景入口,使微信内AI入口总数达到16个。新增功能包括:公众号常看的号页面新增AI一键文章总结、长按朋友圈文字可唤起AI点评、聊天看图新增AI处理支持美化与信息提取,覆盖从图片识别到转账提醒的全链路场景,被视为微信从工具型应用向AI原生入口升级的关键信号。
昆仑万维发布Mureka V9.5:AI音乐转向人情味创作
昆仑万维正式发布AI音乐生成模型Mureka V9.5,是V9系列的最新升级版本。相较前代的高音量、高饱和度强刺激路线,新版转向克制、留白、自然的创作风格,重点强化消除机械感与增添人味儿。核心升级在于深化自研MusiCoT音乐思维链框架——不再直接生成音频波形,而是以思维链推理驱动分步合成,使歌曲在结构、过渡与耐听度上明显改善。
Stripe 超 70 亿美元收购 OpenRouter
彭博社称支付巨头 Stripe 已敲定对 AI 模型聚合平台 OpenRouter 的收购,交易金额超过 70 亿美元,约为后者 B 轮 13 亿美元估值的 5 倍以上。OpenRouter 自称平台全球用户达 800 万,可提供逾 400 种模型统一调用入口。
腾讯 QQ Bot 接入 DeepSeek Harness,支持单聊与群聊
腾讯 QQ 官方宣布 QQ Bot 机器人接入 DeepSeek Harness 智能体框架及官方插件,接入仅需 3 步,支持单聊和群聊场景下的 AI 智能体能力。DeepSeek Harness 是深度求索推出的智能体开发框架,可帮助开发者快速构建具备工具调用、代码执行等能力的 AI Agent。
小红书开源多模态大模型 dots3.note preview
小红书 dots 模型实验室开源 dots3.note preview,为 dots3 系列首个开源版本。模型总参数 280B、激活 16B 的 MoE 架构,支持 512K 超长上下文,原生具备文本、视觉与语音全模态理解能力,针对复杂推理、Agent 任务与多模态感知场景优化。在多项基准测试中可比肩参数数倍的大模型,并在昇腾 Atlas 800A3 / 900A3 上完成 0Day 适配(基于 vLLM-Ascend)。
MiniMax 开源音乐生成模型 MiniMax-Music3
MiniMax 开源音乐生成大模型 MiniMax-Music3,支持最长 5 分钟歌曲生成并可同时输出歌词。采用 8B 全局模型 + 0.6B 局部模型的分层架构,全局层负责长程语义与段落结构,局部层恢复细粒度声学细节;输出 32kHz 立体声 WAV,可保持主题、节奏、歌声音色与编曲推进,覆盖前奏、主歌、副歌、桥段等完整曲式结构。
智谱推出最强编程开源大模型 GLM-5.3
智谱正式发布 GLM-5.3 开源版本,基座未变、通过后训练 Scaling 显著抬高智能上界,已成为当前编程能力最强的开源大模型。在 Terminal Bench 3.0 等多项基准测试中取得开源第一,模型同时涌现出强大网络安全能力,在代码审查与漏洞发现任务中表现突出。智谱联合多家安全团队累计发现 2,436 个漏洞,并启动”开源的盾”生态计划。
谷歌推出主力模型 Gemini 3.7 Flash,主打编程与 Agent
Google 推出 Gemini 3.7 Flash,专为编程与 Agent 场景设计。模型在软件工程、知识工作及网页开发等任务上较上一代大幅提升,上下文窗口扩展至 100 万 token。即日起至 2026 年底首发优惠为原 3.6 Flash 的一半:输入 \$0.75 / 百万 token,输出 \$3.75 / 百万 token。深度集成 Gemini for Workspace,工具调用与多步任务编排能力同步升级。
DeepSeek 同日发布 V4-Pro 正式版与开源智能体框架 Harness
DeepSeek 在 8 月 13 日晚同步推出两项重要发布:正式版 DeepSeek-V4-Pro(Agent 能力显著增强,在 Terminal Bench、DeepSWE 等评测集上表现优异,API 原生支持 OpenAI Responses API 格式),以及开源智能体框架 DeepSeek Harness(v0.1 开发者预览,MIT 协议)。Harness 采用”一切皆插件”的 Cordis 架构,模型、工具、会话、UI 均可自由替换,发布半日 GitHub Star 数突破 3 万,对标 OpenAI Codex 与 Anthropic Claude Code。
Lightricks 开源音视频世界模型 LTX-2.5
Lightricks 发布开源权重世界模型 LTX-2.5(22B),支持文本、图像、视频输入生成同步音画。重磅更新包括:全新 Diffusion Video Decoder(改善高速运动场景伪影)、Diffusion Fidelity Rendering(按场景复杂度分配算力)、原生多镜头切换(一次生成连贯分镜)、定制 Gemma 4 12B 文本编码器 + Prompt Enhancer、可选 Duration Predictor(按动作自动决定时长)。官方盲测胜率 67%,超过 Seedance 2.5(65%)与 MiniMax H3(50%)。
腾讯推出 Windows 桌面美化工具小鹅桌面
腾讯正式上线 Windows 桌面美化与轻量效率工具 小鹅桌面,永久免费、无广告。核心功能:百万级 4K 动态/静态壁纸 + 自动轮播、头像与桌面小组件库、一键整理桌面、内置轻量 AI 对话窗口(支持待办备忘、截止日期识别与简单总结)、本地 + 云端文件搜索。定位”个人美化与日常效率”,与 WorkBuddy 等办公 Agent 错位互补。
B 站开源零样本语音克隆模型 IndexTTS-2.5
B 站 IndexSpeechTeam 开源零样本多语种 TTS 模型 IndexTTS-2.5(0.8B),支持中文、英文、日文、西班牙文、阿拉伯文五语种的语音克隆与跨语种迁移。重构推理架构后推理速度提升 2.28 倍(RTF 0.2065@4090 bf16),新增 0.5–2.0 倍语速控制、拼音/CMU/假名发音控制、4 路径情感控制(参考音频 / 八维向量 / 文本推断 / 描述文本)。采用 Bilibili Model License 开源,配套 WebUI(7860 端口)与 vLLM 部署方案。
月之暗面Kimi正式发布k2模型,具备超强代码和 Agent 能力
月之暗面正式推出基于MoE架构的新一代基础大模型k2,总参数规模达1T,激活参数32B,支持最长128k tokens上下文处理,具备强大的代码生成与智能体(Agent)能力。模型原生支持ToolCalls、JSON/Partial输出及联网功能,但暂不支持视觉输入。定价方面,输入费用为¥1.00/百万tokens,输出¥4.00/百万,缓存命中¥16.00/百万,在多个性能指标上全面领先当前主流开源模型。
拍我AI(PixVerse)上线多关键帧生成功能,从“片段”迈向“故事性表达”
拍我AI(PixVerse)全新上线“多关键帧生成”功能,支持用户上传最多7张图片,基于首尾帧模式生成最长30秒的视频内容,实现人物动作、场景变化与镜头语言的自然过渡。该功能显著提升了短剧、广告、故事类视频的生成效率,标志着AI视频从静态片段向完整叙事的跃迁。
欧盟《通用人工智能行为准则》8月2日实施
欧盟公布最终版《通用人工智能行为准则》,将于8月2日正式生效。该准则聚焦安全、透明与版权保护三大方面,由专家联合多方制定。企业可自愿签署以减轻合规负担,现有模型有2年调整期,新模型为1年。
墨刀AI上线”30秒生成原型图”功能
墨刀AI推出全新原型自动生成能力,支持输入文字描述、草图或截图,30秒内即可产出可交付界面。用户可通过多轮对话优化设计,并自动生成产品文档与页面逻辑,面向产品经理和设计师提供零门槛体验。
微软发布高性能端侧模型Phi-4-mini-flash-reasoning
微软推出专为端侧优化的AI模型Phi-4-mini-flash-reasoning。该模型在数学与逻辑推理任务上表现突出,推理吞吐量提升10倍,延迟降低至三分之一。现已上线Azure AI Foundry等平台。
马斯克发布Grok 4,处理学术问题达到博士级别
马斯克旗下xAI发布新一代大模型Grok 4,推理能力较前代提升10倍,在多项基准测试中超越现有模型,达到”博士后水平”。Grok 4支持工具调用、语音交互、多模态任务,并在ARC-AGI等高难度测试中刷新纪录。
办公小浣熊·桌面版全新上线!
商汤科技推出”办公小浣熊”桌面版,支持Windows和Mac平台,用户无需浏览器即可一键唤醒AI助手,实现任务拆解、数据分析、图表生成等办公功能。老用户可同步历史内容。
智谱Z.ai推出实验性大模型GLM-Experimental
智谱AI推出全新实验模型GLM-Experimental,主打”AI Presentation”功能,可一键生成网页版PPT,支持多种风格与互动效果。用户只需输入简单Prompt,模型可自动生成内容、设计排版,实现弹幕、动画等高级效果。
Perplexity推出AI浏览器——Comet
Perplexity发布AI浏览器Comet,主打”从浏览到思考”,整合网页解释、任务执行等功能,成为用户的”思考伙伴”。Comet目前仅向高价订阅用户开放。
抖音快手前高管创业,上线AI图片工具KIRA
由抖音、TikTok、快手前核心成员创立的AI图片生成工具KIRA正式亮相。产品由ILLA Cloud孵化,支持一键替换/移除背景、修补、画质增强、扩图等操作,并具备AI生成图片能力。创始团队包括曾任抖音 & TikTok研发、快手孵化业务大前端负责人陈龙博,及抖音、快手多项战略项目设计负责人吴晓松。
浙公网安备33010202004812号