
AI工具箱聚合全球人工智能领域的最新资讯、行业要闻、融资进展、产品迭代、技术突破与独家爆料,全天候实时更新,帮助你第一时间掌握行业趋势与关键变化。
加入AI交流群,获取权威信息源,抢占AI时代先机!
马斯克 xAI 将 Grok Bot 适配 iPad 与安卓,补全四大终端
马斯克旗下 xAI 将 Grok Bot 适配至 iPad 与安卓端,补齐 Mac、iPhone 后实现四大终端全覆盖。Grok Bot 定位 AI 智能体协作平台,支持多个 Agent 24 小时组队执行任务、跨应用登录并共享任务上下文,可在机器人之间传递信息、协同推进项目。目前该功能已向全平台用户开放。
微软推出 MAI-Image-2.6-Flash:生图速度达 GPT-Image-2 的 2.8 倍
微软近日通过 Microsoft Foundry 开放 MAI-Image-2.6-Flash 公开预览,面向高吞吐生产负载。官方称其生成速度达 GPT-Image-2-Medium 的 2.8 倍、GPU 效率提升 72%,保持旗舰级画质,支持多图参考编辑与动态宽高比,最高输出 1.5K 分辨率。
谷歌 DeepMind 发布 WeatherNext 3:每小时刷新、5 公里分辨率全球预报
谷歌 DeepMind 近日发布 WeatherNext 3,号称迄今最精准的全球天气 AI 模型。它直接吸收实时卫星观测、每小时生成全球预报,将温湿度等地面变量分辨率提至 5 公里(较上代 25 公里网格清晰约 5 倍),已接入谷歌搜索、地图与 Gemini。
匿名模型 Omen Alpha 上线 OpenCode,线索指向智谱 GLM 系列
继 Ox Alpha 确认为智谱 GLM-5.3-Flash 后,新模型 Omen Alpha 近日上线 OpenCode Go,多方线索指向其同样来自智谱,但厂商尚未正式认领。该模型延续匿名 Alpha 路径,参数与能力未公开,社区据接口特征推断其定位。
英伟达开源 PAIR:本地 AI 跨设备调度新方案
英伟达以开源测试版发布本地 AI 调度工具 NVIDIA PAIR(Personal AI Router),可在局域网内为本地 AI 请求自动选择空闲的 Mac 或 RTX PC 执行推理,类似把任务分派给空闲工位的调度员,缓解单设备算力瓶颈,面向开发者与小型团队的本地化部署场景。
谷歌 Lyria 3.5 登陆 Gemini:一键生成 3 分钟完整歌曲
谷歌于9月5日宣布在 Gemini 应用与 Gemini API 中上线音乐生成模型 Lyria 3.5,支持一键生成最长3分钟的完整歌曲,标志其音乐AI从内部实验工具 Flow Music 走向主流用户与开发者生态。该模型继承 Lyria 3 系列多模态生成能力,面向歌词创作与人声合成场景。
微软推出最强语音转写模型 MAI-Transcribe-2
微软推出最强 AI 语音转写模型 MAI-Transcribe-2,在 60 种语言的 FLEURS 测试中平均词错误率仅 5.2%,准确率与速度均领先同类语音转写模型,支持说话人分离、逐词时间戳与 verbatim/clean 双模式,已在 Microsoft Foundry、OpenRouter 开放调用。
英伟达约130亿美元收购开源AI平台 Hugging Face
英伟达宣布以约129.3亿美元收购全球最大开源AI平台 Hugging Face,交易含119亿美元股东付款与最高10亿美元员工股权激励。Hugging Face 目前汇聚超1800万名开发者、托管300余万个开源模型,收购后将继续保持开放定位、不强制绑定英伟达算力。这笔交易标志着英伟达从芯片层向「算力+模型分发+开发者生态」全栈延伸,是近年全球AI基础设施领域规模最大的收购之一。
OpenAI 推出最新旗舰大模型 GPT-6 Astra
OpenAI 推出 GPT-6 Astra,官方称其为迄今最智能、对齐程度最高的旗舰大模型,首次达到关键级网络安全门槛,可自主发现并修复未知漏洞,在计算机操作、软件工程与科研任务上刷新多项纪录。
谷歌推出推理与编码模型 Gemini 3.8
谷歌正式推出 Gemini 3.8 系列,包含通用推理与编码模型 Gemini 3.8 Flash,以及专注漏洞发现与自动补丁修复的 Gemini 3.8 Flash Cyber。3.8 Flash 在长程软件工程基准 DeepSWE v1.1 上得分 71.0%,较 3.7 Flash 的 65.3% 明显提升,并在多项编码基准上超越 GPT-5.6 Sol;API 价格维持每百万 Token 输入 0.75 美元、输出 3.75 美元不变,Flash Cyber 通过 Fairwind Program 向可信防御方开放。
Meta 推出新一代大语言模型 Muse Spark 1.3
Meta 正式发布新一代大语言模型 Muse Spark 1.3,专注长程智能体与编码场景。新版本在编码基准上超越 GPT-5.6 Sol、与 Claude Fable 5.1 持平,支持 1M tokens 上下文窗口,工具调用较前代减少约 20%、Token 消耗降低约 25%,API 维持输入 1.25 美元 / 输出 4.25 美元每百万 tokens 的定价。
腾讯混元开源 Hy4 preview 轻量版
腾讯混元正式推出 Hy4 preview 轻量版 并开源,通过自研 Sherry 稀疏三值量化与 MIX-STQ1_0 混合精度策略,将模型权重从约 1.5 TB 压缩至 214 GB(体积减少约 86%),在主流任务上表现接近 BF16 原版。轻量版已上线 Hugging Face 与 GitHub,支持 llama.cpp、vLLM 等框架,可在消费级硬件联合推理部署,为端侧量化场景提供新选择(同类参考 Hy-MT2)。
阿里云 Qwen 3.8-Max 发布 0902 版本,编程与多步推理登顶
阿里云千问团队发布 Qwen 3.8-Max 的 0902 版本,针对编程与专业办公场景做了强化后训练。新版本在 CodeArena 前端编程总榜以 1691 分登顶,多步推理、工具调用与端到端 App 生成能力刷新全球上限,每百万 Tokens 调用成本仅 5 美元。
阿里云「万有无界」企业级 Agent 协作平台开启公测
阿里云推出企业级 Agent 协作平台 万有无界 并开启公测,底层可调用旗舰模型 Qwen 3.8-Max 等。平台将复杂任务拆给多位不同职责的 Agent,通过项目空间、群聊协作与资产库推进工作,内置「小万」个人助理与「小有」项目经理两个主 Agent,覆盖影视、制造等多行业场景。
Kimi API 已原生支持 Codex 和 Claude Code
Kimi 开放平台宣布 API 功能更新,原生支持 Codex 与 Claude Code 接入。Kimi API 现已兼容 OpenAI Responses API 格式与 Anthropic Messages API 格式,用户无需格式转换或本地代理,可直连 Kimi K3、Kimi K2.7 Code 等模型。
Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1两款模型
Anthropic 推出 Claude Fable 5.1 与 Claude Mythos 5.1 模型,定位“全球最先进的编程与知识工作模型”。Claude Fable 5.1 面向所有用户,Claude Mythos 5.1 仅限审核机构使用。性能方面,Claude Fable 5.1 在 Terminal-Bench-Science、CursorBench 等多项基准测试中超越前代及 GPT-5.6 Sol。
李飞飞 World Labs 推出全球首个多模态世界模型 Atlas
李飞飞旗下 World Labs 推出全球首个多模态世界模型 Atlas,采用多模态自回归扩散 Transformer 架构,支持像素级相机控制生成图像与视频、3D 场景重建及时空模拟。Atlas 在相机控制生成和 3D 重建任务中均超越现有 SOTA 模型,被视为机器人 Real-to-Sim 的关键一步,目前正向部分合作伙伴开放早期访问。
Meta 推出首个实时音频感知模型 Muse Voice Transcribe
Meta 推出首个实时音频感知模型 Muse Voice Transcribe,整合流式语音识别、说话人分离与端点检测,支持 20 余人分轨转写及 70 余种语言。模型采用自适应延迟机制,兼顾实时响应与识别准确度,在 Artificial Analysis 流式语音转文本排行榜位列第一。
腾讯开源通用多模态 Embedding 模型 WeMM-Embedding
腾讯微信视觉团队开源的通用多模态 Embedding 模型 WeMM-Embedding 提供 2B/4B/9B 三档,支持文本、图像、视频、视觉文档及交错多模态输入统一编码,在 MMEB-v2 基准排行榜位列第一。模型基于 Qwen3.5 架构,采用两阶段训练与 Matryoshka 灵活维度输出。
小红书 FireRed 推出通用音频语言模型 FireRedAudio
小红书 FireRed 团队推出的通用音频语言模型 FireRedAudio 基于 9B 参数 Qwen3.5 架构,采用解耦连续表征设计,同时支持 ASR、音频问答、长音频理解、Zero-shot TTS、指令 TTS 与语音编辑六大任务。模型在 MMAU、MMSU、102 语种 ASR 及 Instruct TTS 等评测中均取得领先,FLEURS-102 平均错误率仅 14.94%。
DeepSeek-V4-Flash-Vision-Exp 模型正式开源
DeepSeek 于 2026年8月31日在 Hugging Face 以 MIT 协议开源 V4 系列首个多模态模型 DeepSeek-V4-Flash-Vision-Exp(此前已于 8月21日上线 DeepSeek API 平台)。模型原生支持图片输入,可完成图像描述、文字识别与图表分析,兼容 JPEG/PNG/GIF/WebP 四种格式。在视觉 Agent 基准中,其多模态 Agent 能力已接近 Claude Opus 4.8,纯文本任务则与 V4-Flash 正式版持平。
Loopit 开源实时交互视频世界模型 Zing-0.5
Zing-0.5 是 Loopit 开源的实时交互视频世界模型,参数规模 5B,基座采用 Wan2.2-TI2V-5B,以 Apache 2.0 协议开放代码与权重。模型支持键盘操控与自然语言语义改写的联合控制,单卡 RTX 5090 实时生成超 24 FPS,一分钟流式推理成本约 6 分钱,在 WBench 实时世界模型评测中位列第一。
蚂蚁百灵推出首个金融增强模型 Ling-3.0-flash-Fin
Ling-3.0-flash-Fin 是蚂蚁百灵推出的首个金融增强模型,延续 Ling-3.0-flash 的 124B 总参数 / 5.1B 激活参数 MoE 架构,面向真实金融工作流,强化信息检索、研究推理、估值建模与研报撰写四大能力,在 FinFIRST、FinSearchComp Verified 等金融智能体基准上表现优异。
OpenAI 宣布终止与 Cursor 合作,11月12日起切断模型访问
OpenAI 因 SpaceX 收购后的合规顾虑,宣布将于 11 月 12 日起终止向 Cursor 提供模型访问,称无法确信其遵守服务条款;Cursor 回应 OpenAI 模型承载其约 5% 流量,正与对方沟通解决。
索尼、华纳等唱片公司起诉 Anthropic,指控非法抓取版权作品训练 Claude
索尼音乐、华纳音乐等唱片公司起诉 Anthropic 及其 CEO Dario Amodei,指控其未经许可使用数万首版权音乐作品(主要为歌词)训练 Claude,被称是史上规模最大的知识产权侵权案之一。
Grok Bot 接入 X 平台,付费用户获免费 API 额度
SpaceXAI 将 Grok Bot 接入 X 平台,用户关联账号后可搜索帖子、读取时间线、查看提及并管理书签,付费用户同步获免费 X API 额度;目前仅支持读取,暂不能发帖或回复。
Anthropic 发布 MHS:面向物理设备的 AI 智能体统一控制标准
Anthropic 推出 MHS(Model Hardware Standard),一套让 AI 智能体统一控制显微镜、机械臂等实体设备的标准接口,把 MCP 的”软件工具标准化”思路平移到硬件侧,可将设备集成从数周压缩到小时级。底层能力依托 Claude Opus 4.6 等模型,标准本身保持中立,研究预览期结束后将开源。
Midjourney V8.2 上线:图像模型聚焦美学与个性化,新增指令编辑能力
Midjourney V8.2 图像模型已作为默认版本上线,重点提升画面美学、图像质量与个性化理解;配套首款 V8.2 图像编辑模型开放公测,支持文本指令改图、多图参考(最多 4 张)、局部重绘(inpainting)与画布扩展(outpainting),并兼容个性化、情绪板与风格参考。
阿里发布全新 Qoder:从 AI 编程工具升级为智能体工作台
阿里巴巴发布全新 Qoder,以 Coding 为核心底座、面向所有人打造的智能体工作台,用户用自然语言描述目标即可驱动 Agent 完成”读—改—验证—迭代”的长链路任务;内置 Qwen3.8-Max 等模型与 Auto 智能调度,提供编程/通用双模式,累计服务全球超 600 万用户、超 10 万家企业客户。
腾讯混元新一代旗舰模型 Hy4 preview 上线预览
腾讯混元新一代旗舰模型 Hy4 preview 已开放预览版,采用 770B 总参数与 49B 激活参数的稀疏架构,原生支持 100 万 token 上下文窗口。官方实测显示,端到端推理吞吐较上一代提高 31.8%,在代码编写、办公文档、游戏开发与科研计算四类真实生产力任务中均有明显增益。科研侧进展更受关注:分子动力学模拟效率提升至原先的 2 倍,并把三维 Blaschke-Lebesgue 体积下界这一悬置百年的几何难题推进到 0.41104。
谷歌发布视频生成模型 Gemini Omni 1.1 Flash,最高 4K 直出
谷歌发布视频生成模型 Gemini Omni 1.1 Flash,最高可直出 4K 成片。它支持从已有片段尾部续写,每次延长 10 秒、单条累计最长 40 秒,只需指定首尾帧即可完成平滑转场与运镜。分辨率覆盖 360p 到 4K 多档,360p 预览模式生成速度快 60%、成本仅三分之一,适合分镜快速迭代;另可挂载最长 3 秒参考视频锁定角色与场景一致性。按秒计费,720p 每秒 0.1 美元、4K 每秒 0.3 美元。
阿里通义千问推出海外AI办公平台 QwenWork
QwenWork是阿里通义千问面向海外市场推出的AI办公生产力平台,集成文档处理、表格分析与智能写作等能力,主打多语言协作与企业级工作流自动化。
腾讯混元推出端侧翻译大模型 Hy-MT2-1.8B
腾讯混元最新端侧翻译引擎Hy-MT2的1.8B轻量版利用自研Sherry 1.25-bit量化加2-bit压缩方案,将原3.3GB体积的模型在几乎不损失翻译水准的前提下缩到可端侧部署的体积,实测翻译效果超越微软及豆包等商用接口。该模型与英特尔合作做了x86指令集级算子适配后,已接入B站直播的弹幕实时翻译管线,覆盖33个语种方向,单条弹幕从输入到输出仅耗时500到800毫秒。
智谱推出原生多模态模型GLM-5.3-Flash
作为GLM-5系列首个原生多模态产品,GLM-5.3-Flash在320B总参数架构下仅激活18B即完成推理。AA基准测试得分57,追平Claude Opus 4.8,而API调用成本仅约后者的2.5%。模型以线性与稀疏双重注意力交替运行削减长序列开销,视觉模块直接编入主干网络,具备自主编写代码、操控浏览器及理解图形界面能力。
通义千问发布多模态MoE大模型Qwen3.8-Flash
Qwen3.8-Flash是阿里通义基于MoE混合专家架构打造的新模型,125B参数量下每个token仅路由激活6B。上下文窗口原生262K并支持YaRN外推至100万token。底层做了四项革新——GDN与QSA双路注意力、门控残差机制、N-gram词嵌入策略以及Muon训练优化器,把预填充吞吐推到上一代的8.6倍同时把训练花费砍到九分之一。商用API按每百万token计费,输入0.8元输出2.7元。
谷歌推出语音转文本模型 Gemini 3.5 Transcribe
谷歌最新语音转写引擎Gemini 3.5 Transcribe主打”理解式转写”——能自动识别并剔除说话中的”嗯””呃”等语气词以及口误自我更正内容,输出可直接使用的干净文本。与上一代Chirp 3引擎对比,处理速度提高约70%,实时流式场景下词错率压到5.5%以内。模型覆盖85种语言,预录模式支持最多3人同时说话的声纹区分,目前已在Pixel 11手机的Gboard输入法Rambler功能中实装。
谷歌实验室推出实时协作Vibe Coding工具Play with Putty
Play with Putty是谷歌实验室推出的实时协作工具,主打Vibe Coding体验。用户无需编程基础,通过自然语言描述需求,AI即可自动生成代码并实时渲染为可用工具或网站;支持多人通过链接进入同一共享空间协作,修改即时同步。产品定位轻量消费级实验工具,目前处于排队等候阶段。
Stability AI 完成 7600 万美元 B 轮融资
Stability AI宣布完成7600万美元(约5.12亿元人民币)B轮融资,投资方包括EA、索尼音乐、环球音乐、华纳音乐及AMD风投部门,资金将用于创意产品开发、应用研究及专业服务扩展。CEO Prem Akkaraju表示投资者将带来专业知识与行业信誉,助力生成式AI赋能创意人士。
即梦AI推出影视内容厂牌「即梦片场」
即梦AI正式推出影视内容厂牌「即梦片场」,2026年8月至12月面向影视公司与AI创作者征集电影及剧集项目。电影设S、A两档扶持,剧集设S、A、B三档,提供算力、技术与发行全链路支持,联动番茄小说IP资源。同步推出创作者成长计划,优质作品最高可获10万元现金与百万宣推资源。
爱诗科技推出实时全模态世界模型 PixVerse R2
爱诗科技发布实时全模态世界模型PixVerse R2技术报告。R2在PixVerse R1基础上探索实时世界模型持续Scaling路径,通过Omni Causal AR统一架构支持文本、参考图、音频、动作等多模态输入,实现边生成、边交互、边演化的持续世界运行。模型采用Block-sparse Attention将稀疏度提升至90%以上,Error Bank使长期亮度漂移下降约35.8%。
小红书开源统一语音生成与编辑模型 FireRedTTS3
小红书 FireRed 团队开源统一语音生成与编辑模型FireRedTTS3。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现 24 种语言及 21 种中文方言的零样本音色克隆、自然语言声音设计与指定区域精准语音编辑。模型在四个公开评测集上均取得最优成绩,为有声内容、游戏配音及品牌客服等场景提供高效解决方案。
RunningHub 首发上线阿里视频生成模型 Wan3.0:单次最长30秒,PPT一键转视频
RunningHub首发完成对阿里视频生成模型Wan3.0的全栈适配——单次生成最长 30 秒视频,支持文本、图片、音频、视频及 doc/ppt/pdf 等文档格式输入,可一键把 PPT 转成教学或营销视频。人物与场景一致性显著提升,RunningHub 旗下 rhTV、RHSTORY、ComfyUI 等生态已同步适配,覆盖影视、广告、电商等商用场景,用户无需本地部署即可按量调用。
LiblibAI 推出海外AI视频创作平台 Newtake:接入 Seedance 2.5,月付 $19 起
LiblibAI 面向海外市场推出 AI 视频创作平台Newtake,定位「导演工具」。平台基于无限画布与节点工作流,集成导演控制台、电影感灯光、多视角解析及纹理角色表等功能,通过角色一致性管理解决 AI 视频「变脸」痛点,已接入 Seedance 2.5、MiniMax H3 等模型。订阅月付 $19 起,免费用户每日登录可领 100 积分。
阿里通义万相视频大模型 Wan3.0 正式上线:单次生成30秒视频,首创支持办公文档直接转视频
阿里通义万相视频大模型Wan3.0正式上线,单次生成时长从此前的10秒级别跃升至30秒,并首创支持doc、xls、ppt、pdf、md等文档格式直接转视频——PPT上传就能变教学课件。模型落地短剧、影视、广告、文旅、音乐MV等场景;API按秒计费,480P/720P/1080P分别0.3/0.6/1.2元/秒,相比可灵3.0订阅制有更清晰的成本可控性。
中国电信天翼AI推出桌面级通用智能体助手TeleAgent
中国电信天翼AI于2026年8月21日正式推出桌面级通用智能体助手TeleAgent(星辰超级智能体),定位”AI办公搭子”,支持Windows 10(64位)及以上与macOS 13及以上系统。与普通AI”问一句答一句”不同,TeleAgent以”任务交付”为核心——自动完成文件整理、深度调研、文档写审、应用生成四大办公场景,用户下达指令即可获得直接可用的成果,默认”先列方案再执行”兼顾自动化与可控性,本地驻留+不强制上传的策略适合财务、商业机密等敏感场景。
蚂蚁百灵开源Ling-3.0基座模型:6个训练节点权重全开放
蚂蚁百灵正式开源 Ling-3.0-tiny-base(总参7.9B/激活1.3B)与 Ling-3.0-flash-base(总参124B/激活5.1B)两个基座模型,并同步开放预训练、中期训练与WSM合并共6个训练节点权重,全部采用MIT许可证。官方基准显示tiny-base在HumanEval-Plus取得 79.27,领先Qwen3.5-9B-base的52.44;配套推理版Ling-3.0-tiny已上线OpenRouter。
商汤开源SenseNova U1.5-8B-MoT正式版:Apache 2.0许可证
商汤科技开源原生统一多模态大模型 SenseNova U1.5-8B-MoT 正式版,许可证Apache 2.0。模型基于NEO-unify架构,无视觉编码器与VAE,原生支持4K输出、图像编辑与交错图文生成,官方说明其在指令遵循、文字排版、图像编辑等 六个 方面较Preview版全面升级,配套LoRA-8step加速权重同步开源。此前预览版体验可参考SenseNova U1.5-Lite-Preview。
Mistral推出Agentic Search:多步检索将复杂文档准确率提升至86%
Mistral AI正式推出Mistral Agentic Search智能体搜索检索层,引入多步检索循环机制,为模型赋予search、open、navigate、read、grep等文档级操作工具。在FinanceBench金融文档基准测试中,基于368份平均约147页的SEC文件,完整agentic循环准确率从单次RAG的27%提升至86%,提升约3倍;p90延迟从255秒降至154秒,token消耗减少最高33.7%。该工具支持云端Studio/Vibe和本地Docker+Vespa部署。
xAI Grok Build 正式全量上线:覆盖网页与移动端,支持一句话生成应用
xAI 的 Grok Build 已结束早期测试,正式向所有套餐用户开放网页端、iOS 与 Android。用户在与 Grok 对话中用自然语言描述需求,即可实时生成并运行应用或小游戏;发布后可获得 grok.me 专属链接、富预览封面,并支持在 X 以互动卡片形式分享与 Remix 二次改造。
DeepSeek Harness 升级 0.1.1-rc.1,新增视觉模型 V4-Flash-Vision-Exp
DeepSeek 将开源工具链 DeepSeek Harness 升级至 0.1.1-rc.1 版本,在 V4-Flash 与 V4-Pro 基础上新增视觉模型体验版 DeepSeek-V4-Flash-Vision-Exp。前一日发布的 v0.1.0-rc.8 已支持原生图片请求与 /goal、/plan 等指令的图文混合输入,开发者通过 npm 升级即可让 Agent 直接“看图干活”,补全多模态处理闭环。
Adobe Firefly 音频生成工具全面上线:覆盖音乐、语音与音效
Adobe 的 Adobe Firefly 音频生成工具正式上线,支持在桌面与移动端创作商业安全级别的音乐、语音与音效。调查显示 32.7% 的受访创作者已在视频中使用 AI 生成音乐,43.2% 将法律版权风险视为主要障碍,38.9% 则担心授权费用,Firefly 的商用授权模式试图降低这些顾虑。
OpenAI开源Codex Harness:AI Agent底层执行框架,ARC-AGI-3成绩飙升近3倍
OpenAI开源AI Agent底层执行框架Codex Harness,负责任务理解、工具调用、沙箱执行与人类审批等完整执行循环,支持CLI、SDK与app-server三大接入方式。官方基准显示,仅优化Harness层即可让GPT-5.6 Sol的ARC-AGI-3得分从13.3%跃升至38.3%,Token消耗减少约6倍。
阿里通义发布Qwen-UI-Agent:真机训练的GUI智能体基座,八项基准全面领先
阿里通义推出GUI智能体基座模型Qwen-UI-Agent,基于100多台真机与150多个应用训练,支持GUI与命令行混合执行和100步以上长程任务,在MobileWorld、OSWorld、WebArena等八项基准上全面超越或持平GPT-5.6、Claude Opus等旗舰模型。
DeepSeek Harness重磅更新:多模态支持全面上线,/goal与/plan命令可带图
DeepSeek Harness在发布一周内迎来重大升级,正式加入多模态能力。模型适配器现在可启用原生图片请求,/goal、/plan等指令支持直接带图发送,@引用体验也同步优化。这一更新让智能体在视觉任务中的可用性大幅提升,也被外界解读为DeepSeek V4视觉版可能临近的信号。
MiniMax Design发布:基于H3多模态视频模型,自然语言即可指挥创作
MiniMax推出商业内容生产平台MiniMax Design,基于MiniMax H3原生多模态视频模型,将视频创作从”操作像素”推进到”操作语义”阶段。用户只需用自然语言描述意图,系统即可自动拆解任务并调用模型完成生成,目标是把前沿模型能力直接转化为商业视频生产力。
Meta推出Mac版AI助手:支持屏幕共享与跨应用语音输入
Meta正式发布Mac版Meta AI助手桌面应用,支持共享屏幕窗口后由AI基于画面内容提供建议、问答与生成,同时支持跨应用语音输入。此举意在将AI聊天机器人升级为生产力助手,与Google Gemini、ChatGPT和Claude的桌面布局展开正面竞争。
Anthropic延长Claude Code额度50%加成至8月31日,探索永久标准方案
Anthropic宣布将AI编程助手Claude Code每周使用额度50%临时加成从原定8月19日截止延长至2026年8月31日,并正探索将其转为订阅配额的永久标准方案。该加成自7月19日起面向Pro、Max、Team及席位制Enterprise用户推出,以应对开发者对Claude Code日益增长的使用需求。Anthropic表示若反馈持续积极,50%额度提升有望成为长期默认配置。
Anthropic预告Claude Code将整合/design命令,支持编码前先画UI原型
Anthropic产品设计师Nate Parrott于8月18日在X平台预告,Claude Code即将整合全新/design命令,开发者可在写代码前于终端或桌面版中创建交互式设计模型。输入”/design a few options for {feature}”即可生成多个UI方案供选择,将设计探索前置到编码流程中,提升从设计到开发的整体效率。这是Anthropic持续扩展Claude Code生态的又一举措。
微信灰度上线AI总结、AI点评、AI修图三大功能
微信iOS版虽未更新版本号,但通过灰度测试悄然上线AI总结、AI点评和AI修图三大功能,覆盖公众号文章总结、朋友圈点评生成和图片智能编辑场景。AI总结可提取公众号文章要点,AI点评为朋友圈内容生成互动评论,AI修图支持图片智能处理。此外Windows/Mac端4.1.13正式版同步新增合并发图和表情动态预览。此前微信已灰度测试原生AI助手小微助手,AI入口持续扩张。
Stripe被曝超70亿美元收购OpenRouter,后者同步下调GPT-5.6 Sol调用费
支付巨头Stripe被曝将以超70亿美元收购模型路由平台OpenRouter,后者全球用户达800万,B轮估值约13亿美元。几乎同时,GPT-5.6 Sol在OpenRouter的调用费已下调50%,输入降至2.5美元/百万tokens,输出降至15美元/百万tokens。
腾讯云落地马来西亚首个云区域,WorkBuddy企业版同步亮相
腾讯云宣布在马来西亚柔佛州设立首个云区域,首期规划3个可用区,并联合当地高校与企业深化AI人才培养。同时,腾讯AI原生办公智能体WorkBuddy企业版也同步亮相,具备超百种办公技能,覆盖消息、文档、表格、邮件与会议等场景。
微软Copilot Notebooks扩展支持Markdown等三种文本格式
微软更新Microsoft 365 Copilot生态下的Copilot Notebooks应用,新增支持Markdown、纯文本和富文本三种格式,进一步强化了AI资料整理与分析能力,方便用户在不同格式间切换编辑和沉淀知识。
微信密集新增AI入口至16个,灰度测试小微助手
微信近期密集上线AI能力,灰度测试原生AI助手小微,新增3个高频场景入口,使微信内AI入口总数达到16个。新增功能包括:公众号常看的号页面新增AI一键文章总结、长按朋友圈文字可唤起AI点评、聊天看图新增AI处理支持美化与信息提取,覆盖从图片识别到转账提醒的全链路场景,被视为微信从工具型应用向AI原生入口升级的关键信号。
昆仑万维发布Mureka V9.5:AI音乐转向人情味创作
昆仑万维正式发布AI音乐生成模型Mureka V9.5,是V9系列的最新升级版本。相较前代的高音量、高饱和度强刺激路线,新版转向克制、留白、自然的创作风格,重点强化消除机械感与增添人味儿。核心升级在于深化自研MusiCoT音乐思维链框架——不再直接生成音频波形,而是以思维链推理驱动分步合成,使歌曲在结构、过渡与耐听度上明显改善。
Stripe 超 70 亿美元收购 OpenRouter
彭博社称支付巨头 Stripe 已敲定对 AI 模型聚合平台 OpenRouter 的收购,交易金额超过 70 亿美元,约为后者 B 轮 13 亿美元估值的 5 倍以上。OpenRouter 自称平台全球用户达 800 万,可提供逾 400 种模型统一调用入口。
腾讯 QQ Bot 接入 DeepSeek Harness,支持单聊与群聊
腾讯 QQ 官方宣布 QQ Bot 机器人接入 DeepSeek Harness 智能体框架及官方插件,接入仅需 3 步,支持单聊和群聊场景下的 AI 智能体能力。DeepSeek Harness 是深度求索推出的智能体开发框架,可帮助开发者快速构建具备工具调用、代码执行等能力的 AI Agent。
小红书开源多模态大模型 dots3.note preview
小红书 dots 模型实验室开源 dots3.note preview,为 dots3 系列首个开源版本。模型总参数 280B、激活 16B 的 MoE 架构,支持 512K 超长上下文,原生具备文本、视觉与语音全模态理解能力,针对复杂推理、Agent 任务与多模态感知场景优化。在多项基准测试中可比肩参数数倍的大模型,并在昇腾 Atlas 800A3 / 900A3 上完成 0Day 适配(基于 vLLM-Ascend)。
MiniMax 开源音乐生成模型 MiniMax-Music3
MiniMax 开源音乐生成大模型 MiniMax-Music3,支持最长 5 分钟歌曲生成并可同时输出歌词。采用 8B 全局模型 + 0.6B 局部模型的分层架构,全局层负责长程语义与段落结构,局部层恢复细粒度声学细节;输出 32kHz 立体声 WAV,可保持主题、节奏、歌声音色与编曲推进,覆盖前奏、主歌、副歌、桥段等完整曲式结构。
智谱推出最强编程开源大模型 GLM-5.3
智谱正式发布 GLM-5.3 开源版本,基座未变、通过后训练 Scaling 显著抬高智能上界,已成为当前编程能力最强的开源大模型。在 Terminal Bench 3.0 等多项基准测试中取得开源第一,模型同时涌现出强大网络安全能力,在代码审查与漏洞发现任务中表现突出。智谱联合多家安全团队累计发现 2,436 个漏洞,并启动”开源的盾”生态计划。
谷歌推出主力模型 Gemini 3.7 Flash,主打编程与 Agent
Google 推出 Gemini 3.7 Flash,专为编程与 Agent 场景设计。模型在软件工程、知识工作及网页开发等任务上较上一代大幅提升,上下文窗口扩展至 100 万 token。即日起至 2026 年底首发优惠为原 3.6 Flash 的一半:输入 \$0.75 / 百万 token,输出 \$3.75 / 百万 token。深度集成 Gemini for Workspace,工具调用与多步任务编排能力同步升级。
DeepSeek 同日发布 V4-Pro 正式版与开源智能体框架 Harness
DeepSeek 在 8 月 13 日晚同步推出两项重要发布:正式版 DeepSeek-V4-Pro(Agent 能力显著增强,在 Terminal Bench、DeepSWE 等评测集上表现优异,API 原生支持 OpenAI Responses API 格式),以及开源智能体框架 DeepSeek Harness(v0.1 开发者预览,MIT 协议)。Harness 采用”一切皆插件”的 Cordis 架构,模型、工具、会话、UI 均可自由替换,发布半日 GitHub Star 数突破 3 万,对标 OpenAI Codex 与 Anthropic Claude Code。
Lightricks 开源音视频世界模型 LTX-2.5
Lightricks 发布开源权重世界模型 LTX-2.5(22B),支持文本、图像、视频输入生成同步音画。重磅更新包括:全新 Diffusion Video Decoder(改善高速运动场景伪影)、Diffusion Fidelity Rendering(按场景复杂度分配算力)、原生多镜头切换(一次生成连贯分镜)、定制 Gemma 4 12B 文本编码器 + Prompt Enhancer、可选 Duration Predictor(按动作自动决定时长)。官方盲测胜率 67%,超过 Seedance 2.5(65%)与 MiniMax H3(50%)。
腾讯推出 Windows 桌面美化工具小鹅桌面
腾讯正式上线 Windows 桌面美化与轻量效率工具 小鹅桌面,永久免费、无广告。核心功能:百万级 4K 动态/静态壁纸 + 自动轮播、头像与桌面小组件库、一键整理桌面、内置轻量 AI 对话窗口(支持待办备忘、截止日期识别与简单总结)、本地 + 云端文件搜索。定位”个人美化与日常效率”,与 WorkBuddy 等办公 Agent 错位互补。
B 站开源零样本语音克隆模型 IndexTTS-2.5
B 站 IndexSpeechTeam 开源零样本多语种 TTS 模型 IndexTTS-2.5(0.8B),支持中文、英文、日文、西班牙文、阿拉伯文五语种的语音克隆与跨语种迁移。重构推理架构后推理速度提升 2.28 倍(RTF 0.2065@4090 bf16),新增 0.5–2.0 倍语速控制、拼音/CMU/假名发音控制、4 路径情感控制(参考音频 / 八维向量 / 文本推断 / 描述文本)。采用 Bilibili Model License 开源,配套 WebUI(7860 端口)与 vLLM 部署方案。
月之暗面Kimi正式发布k2模型,具备超强代码和 Agent 能力
月之暗面正式推出基于MoE架构的新一代基础大模型k2,总参数规模达1T,激活参数32B,支持最长128k tokens上下文处理,具备强大的代码生成与智能体(Agent)能力。模型原生支持ToolCalls、JSON/Partial输出及联网功能,但暂不支持视觉输入。定价方面,输入费用为¥1.00/百万tokens,输出¥4.00/百万,缓存命中¥16.00/百万,在多个性能指标上全面领先当前主流开源模型。
拍我AI(PixVerse)上线多关键帧生成功能,从“片段”迈向“故事性表达”
拍我AI(PixVerse)全新上线“多关键帧生成”功能,支持用户上传最多7张图片,基于首尾帧模式生成最长30秒的视频内容,实现人物动作、场景变化与镜头语言的自然过渡。该功能显著提升了短剧、广告、故事类视频的生成效率,标志着AI视频从静态片段向完整叙事的跃迁。
欧盟《通用人工智能行为准则》8月2日实施
欧盟公布最终版《通用人工智能行为准则》,将于8月2日正式生效。该准则聚焦安全、透明与版权保护三大方面,由专家联合多方制定。企业可自愿签署以减轻合规负担,现有模型有2年调整期,新模型为1年。
墨刀AI上线”30秒生成原型图”功能
墨刀AI推出全新原型自动生成能力,支持输入文字描述、草图或截图,30秒内即可产出可交付界面。用户可通过多轮对话优化设计,并自动生成产品文档与页面逻辑,面向产品经理和设计师提供零门槛体验。
微软发布高性能端侧模型Phi-4-mini-flash-reasoning
微软推出专为端侧优化的AI模型Phi-4-mini-flash-reasoning。该模型在数学与逻辑推理任务上表现突出,推理吞吐量提升10倍,延迟降低至三分之一。现已上线Azure AI Foundry等平台。
马斯克发布Grok 4,处理学术问题达到博士级别
马斯克旗下xAI发布新一代大模型Grok 4,推理能力较前代提升10倍,在多项基准测试中超越现有模型,达到”博士后水平”。Grok 4支持工具调用、语音交互、多模态任务,并在ARC-AGI等高难度测试中刷新纪录。
办公小浣熊·桌面版全新上线!
商汤科技推出”办公小浣熊”桌面版,支持Windows和Mac平台,用户无需浏览器即可一键唤醒AI助手,实现任务拆解、数据分析、图表生成等办公功能。老用户可同步历史内容。
智谱Z.ai推出实验性大模型GLM-Experimental
智谱AI推出全新实验模型GLM-Experimental,主打”AI Presentation”功能,可一键生成网页版PPT,支持多种风格与互动效果。用户只需输入简单Prompt,模型可自动生成内容、设计排版,实现弹幕、动画等高级效果。
Perplexity推出AI浏览器——Comet
Perplexity发布AI浏览器Comet,主打”从浏览到思考”,整合网页解释、任务执行等功能,成为用户的”思考伙伴”。Comet目前仅向高价订阅用户开放。
抖音快手前高管创业,上线AI图片工具KIRA
由抖音、TikTok、快手前核心成员创立的AI图片生成工具KIRA正式亮相。产品由ILLA Cloud孵化,支持一键替换/移除背景、修补、画质增强、扩图等操作,并具备AI生成图片能力。创始团队包括曾任抖音 & TikTok研发、快手孵化业务大前端负责人陈龙博,及抖音、快手多项战略项目设计负责人吴晓松。
浙公网安备33010202004812号