每日AI快讯热闻

AI快讯55秒前更新 老高
3,668 0
每日AI快讯

AI工具箱聚合全球人工智能领域的最新资讯、行业要闻、融资进展、产品迭代、技术突破与独家爆料,全天候实时更新,帮助你第一时间掌握行业趋势与关键变化。
加入AI交流群,获取权威信息源,抢占AI时代先机!

9月7日 周一

马斯克 xAI 将 Grok Bot 适配 iPad 与安卓,补全四大终端

马斯克旗下 xAI 将 Grok Bot 适配至 iPad 与安卓端,补齐 Mac、iPhone 后实现四大终端全覆盖。Grok Bot 定位 AI 智能体协作平台,支持多个 Agent 24 小时组队执行任务、跨应用登录并共享任务上下文,可在机器人之间传递信息、协同推进项目。目前该功能已向全平台用户开放。

来源:IT之家
9月6日 周日

微软推出 MAI-Image-2.6-Flash:生图速度达 GPT-Image-2 的 2.8 倍

微软近日通过 Microsoft Foundry 开放 MAI-Image-2.6-Flash 公开预览,面向高吞吐生产负载。官方称其生成速度达 GPT-Image-2-Medium 的 2.8 倍、GPU 效率提升 72%,保持旗舰级画质,支持多图参考编辑与动态宽高比,最高输出 1.5K 分辨率。

来源:微软AI官方博客

谷歌 DeepMind 发布 WeatherNext 3:每小时刷新、5 公里分辨率全球预报

谷歌 DeepMind 近日发布 WeatherNext 3,号称迄今最精准的全球天气 AI 模型。它直接吸收实时卫星观测、每小时生成全球预报,将温湿度等地面变量分辨率提至 5 公里(较上代 25 公里网格清晰约 5 倍),已接入谷歌搜索、地图与 Gemini。

来源:Google 官方博客

匿名模型 Omen Alpha 上线 OpenCode,线索指向智谱 GLM 系列

继 Ox Alpha 确认为智谱 GLM-5.3-Flash 后,新模型 Omen Alpha 近日上线 OpenCode Go,多方线索指向其同样来自智谱,但厂商尚未正式认领。该模型延续匿名 Alpha 路径,参数与能力未公开,社区据接口特征推断其定位。

来源:IT之家
9月5日 周六

英伟达开源 PAIR:本地 AI 跨设备调度新方案

英伟达以开源测试版发布本地 AI 调度工具 NVIDIA PAIR(Personal AI Router),可在局域网内为本地 AI 请求自动选择空闲的 Mac 或 RTX PC 执行推理,类似把任务分派给空闲工位的调度员,缓解单设备算力瓶颈,面向开发者与小型团队的本地化部署场景。

来源:IT之家

谷歌 Lyria 3.5 登陆 Gemini:一键生成 3 分钟完整歌曲

谷歌于9月5日宣布在 Gemini 应用与 Gemini API 中上线音乐生成模型 Lyria 3.5,支持一键生成最长3分钟的完整歌曲,标志其音乐AI从内部实验工具 Flow Music 走向主流用户与开发者生态。该模型继承 Lyria 3 系列多模态生成能力,面向歌词创作与人声合成场景。

来源:IT之家
9月4日 周五

微软推出最强语音转写模型 MAI-Transcribe-2

微软推出最强 AI 语音转写模型 MAI-Transcribe-2,在 60 种语言的 FLEURS 测试中平均词错误率仅 5.2%,准确率与速度均领先同类语音转写模型,支持说话人分离、逐词时间戳与 verbatim/clean 双模式,已在 Microsoft Foundry、OpenRouter 开放调用。

来源:IT之家

英伟达约130亿美元收购开源AI平台 Hugging Face

英伟达宣布以约129.3亿美元收购全球最大开源AI平台 Hugging Face,交易含119亿美元股东付款与最高10亿美元员工股权激励。Hugging Face 目前汇聚超1800万名开发者、托管300余万个开源模型,收购后将继续保持开放定位、不强制绑定英伟达算力。这笔交易标志着英伟达从芯片层向「算力+模型分发+开发者生态」全栈延伸,是近年全球AI基础设施领域规模最大的收购之一。

来源:财联社

OpenAI 推出最新旗舰大模型 GPT-6 Astra

OpenAI 推出 GPT-6 Astra,官方称其为迄今最智能、对齐程度最高的旗舰大模型,首次达到关键级网络安全门槛,可自主发现并修复未知漏洞,在计算机操作、软件工程与科研任务上刷新多项纪录。

来源:IT之家
9月3日 周四

谷歌推出推理与编码模型 Gemini 3.8

谷歌正式推出 Gemini 3.8 系列,包含通用推理与编码模型 Gemini 3.8 Flash,以及专注漏洞发现与自动补丁修复的 Gemini 3.8 Flash Cyber。3.8 Flash 在长程软件工程基准 DeepSWE v1.1 上得分 71.0%,较 3.7 Flash 的 65.3% 明显提升,并在多项编码基准上超越 GPT-5.6 Sol;API 价格维持每百万 Token 输入 0.75 美元、输出 3.75 美元不变,Flash Cyber 通过 Fairwind Program 向可信防御方开放。

来源:AI工具箱

Meta 推出新一代大语言模型 Muse Spark 1.3

Meta 正式发布新一代大语言模型 Muse Spark 1.3,专注长程智能体与编码场景。新版本在编码基准上超越 GPT-5.6 Sol、与 Claude Fable 5.1 持平,支持 1M tokens 上下文窗口,工具调用较前代减少约 20%、Token 消耗降低约 25%,API 维持输入 1.25 美元 / 输出 4.25 美元每百万 tokens 的定价。

来源:AI工具箱

腾讯混元开源 Hy4 preview 轻量版

腾讯混元正式推出 Hy4 preview 轻量版 并开源,通过自研 Sherry 稀疏三值量化与 MIX-STQ1_0 混合精度策略,将模型权重从约 1.5 TB 压缩至 214 GB(体积减少约 86%),在主流任务上表现接近 BF16 原版。轻量版已上线 Hugging Face 与 GitHub,支持 llama.cpp、vLLM 等框架,可在消费级硬件联合推理部署,为端侧量化场景提供新选择(同类参考 Hy-MT2)。

来源:腾讯混元

阿里云 Qwen 3.8-Max 发布 0902 版本,编程与多步推理登顶

阿里云千问团队发布 Qwen 3.8-Max 的 0902 版本,针对编程与专业办公场景做了强化后训练。新版本在 CodeArena 前端编程总榜以 1691 分登顶,多步推理、工具调用与端到端 App 生成能力刷新全球上限,每百万 Tokens 调用成本仅 5 美元。

来源:阿里云

阿里云「万有无界」企业级 Agent 协作平台开启公测

阿里云推出企业级 Agent 协作平台 万有无界 并开启公测,底层可调用旗舰模型 Qwen 3.8-Max 等。平台将复杂任务拆给多位不同职责的 Agent,通过项目空间、群聊协作与资产库推进工作,内置「小万」个人助理与「小有」项目经理两个主 Agent,覆盖影视、制造等多行业场景。

来源:阿里云

Kimi API 已原生支持 Codex 和 Claude Code

Kimi 开放平台宣布 API 功能更新,原生支持 Codex 与 Claude Code 接入。Kimi API 现已兼容 OpenAI Responses API 格式与 Anthropic Messages API 格式,用户无需格式转换或本地代理,可直连 Kimi K3Kimi K2.7 Code 等模型。

来源:Kimi开放平台
9月2日 周三

Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1两款模型

Anthropic 推出 Claude Fable 5.1Claude Mythos 5.1 模型,定位“全球最先进的编程与知识工作模型”。Claude Fable 5.1 面向所有用户,Claude Mythos 5.1 仅限审核机构使用。性能方面,Claude Fable 5.1 在 Terminal-Bench-Science、CursorBench 等多项基准测试中超越前代及 GPT-5.6 Sol

来源:IT之家

李飞飞 World Labs 推出全球首个多模态世界模型 Atlas

李飞飞旗下 World Labs 推出全球首个多模态世界模型 Atlas,采用多模态自回归扩散 Transformer 架构,支持像素级相机控制生成图像与视频、3D 场景重建及时空模拟。Atlas 在相机控制生成和 3D 重建任务中均超越现有 SOTA 模型,被视为机器人 Real-to-Sim 的关键一步,目前正向部分合作伙伴开放早期访问。

来源:量子位

Meta 推出首个实时音频感知模型 Muse Voice Transcribe

Meta 推出首个实时音频感知模型 Muse Voice Transcribe,整合流式语音识别、说话人分离与端点检测,支持 20 余人分轨转写及 70 余种语言。模型采用自适应延迟机制,兼顾实时响应与识别准确度,在 Artificial Analysis 流式语音转文本排行榜位列第一。

来源:IT之家
9月1日 周二

腾讯开源通用多模态 Embedding 模型 WeMM-Embedding

腾讯微信视觉团队开源的通用多模态 Embedding 模型 WeMM-Embedding 提供 2B/4B/9B 三档,支持文本、图像、视频、视觉文档及交错多模态输入统一编码,在 MMEB-v2 基准排行榜位列第一。模型基于 Qwen3.5 架构,采用两阶段训练与 Matryoshka 灵活维度输出。

来源:AI工具箱

小红书 FireRed 推出通用音频语言模型 FireRedAudio

小红书 FireRed 团队推出的通用音频语言模型 FireRedAudio 基于 9B 参数 Qwen3.5 架构,采用解耦连续表征设计,同时支持 ASR、音频问答、长音频理解、Zero-shot TTS、指令 TTS 与语音编辑六大任务。模型在 MMAU、MMSU、102 语种 ASR 及 Instruct TTS 等评测中均取得领先,FLEURS-102 平均错误率仅 14.94%。

来源:AI工具箱

DeepSeek-V4-Flash-Vision-Exp 模型正式开源

DeepSeek 于 2026年8月31日在 Hugging Face 以 MIT 协议开源 V4 系列首个多模态模型 DeepSeek-V4-Flash-Vision-Exp(此前已于 8月21日上线 DeepSeek API 平台)。模型原生支持图片输入,可完成图像描述、文字识别与图表分析,兼容 JPEG/PNG/GIF/WebP 四种格式。在视觉 Agent 基准中,其多模态 Agent 能力已接近 Claude Opus 4.8,纯文本任务则与 V4-Flash 正式版持平。

来源:IT之家
8月31日 周一

Loopit 开源实时交互视频世界模型 Zing-0.5

Zing-0.5 是 Loopit 开源的实时交互视频世界模型,参数规模 5B,基座采用 Wan2.2-TI2V-5B,以 Apache 2.0 协议开放代码与权重。模型支持键盘操控与自然语言语义改写的联合控制,单卡 RTX 5090 实时生成超 24 FPS,一分钟流式推理成本约 6 分钱,在 WBench 实时世界模型评测中位列第一。

来源:GitHub(Loopit 官方仓库)

蚂蚁百灵推出首个金融增强模型 Ling-3.0-flash-Fin

Ling-3.0-flash-Fin 是蚂蚁百灵推出的首个金融增强模型,延续 Ling-3.0-flash 的 124B 总参数 / 5.1B 激活参数 MoE 架构,面向真实金融工作流,强化信息检索、研究推理、估值建模与研报撰写四大能力,在 FinFIRST、FinSearchComp Verified 等金融智能体基准上表现优异。

来源:百灵大模型
8月30日 周日

OpenAI 宣布终止与 Cursor 合作,11月12日起切断模型访问

OpenAI 因 SpaceX 收购后的合规顾虑,宣布将于 11 月 12 日起终止向 Cursor 提供模型访问,称无法确信其遵守服务条款;Cursor 回应 OpenAI 模型承载其约 5% 流量,正与对方沟通解决。

来源:OpenAI

索尼、华纳等唱片公司起诉 Anthropic,指控非法抓取版权作品训练 Claude

索尼音乐、华纳音乐等唱片公司起诉 Anthropic 及其 CEO Dario Amodei,指控其未经许可使用数万首版权音乐作品(主要为歌词)训练 Claude,被称是史上规模最大的知识产权侵权案之一。

来源:The Decoder

Grok Bot 接入 X 平台,付费用户获免费 API 额度

SpaceXAI 将 Grok Bot 接入 X 平台,用户关联账号后可搜索帖子、读取时间线、查看提及并管理书签,付费用户同步获免费 X API 额度;目前仅支持读取,暂不能发帖或回复。

来源:AI工具箱
8月29日 周六

Anthropic 发布 MHS:面向物理设备的 AI 智能体统一控制标准

Anthropic 推出 MHS(Model Hardware Standard),一套让 AI 智能体统一控制显微镜、机械臂等实体设备的标准接口,把 MCP 的”软件工具标准化”思路平移到硬件侧,可将设备集成从数周压缩到小时级。底层能力依托 Claude Opus 4.6 等模型,标准本身保持中立,研究预览期结束后将开源。

来源:IT之家

Midjourney V8.2 上线:图像模型聚焦美学与个性化,新增指令编辑能力

Midjourney V8.2 图像模型已作为默认版本上线,重点提升画面美学、图像质量与个性化理解;配套首款 V8.2 图像编辑模型开放公测,支持文本指令改图、多图参考(最多 4 张)、局部重绘(inpainting)与画布扩展(outpainting),并兼容个性化、情绪板与风格参考。

来源:Midjourney 官方

阿里发布全新 Qoder:从 AI 编程工具升级为智能体工作台

阿里巴巴发布全新 Qoder,以 Coding 为核心底座、面向所有人打造的智能体工作台,用户用自然语言描述目标即可驱动 Agent 完成”读—改—验证—迭代”的长链路任务;内置 Qwen3.8-Max 等模型与 Auto 智能调度,提供编程/通用双模式,累计服务全球超 600 万用户、超 10 万家企业客户。

来源:Qoder 官方
8月28日 周五

腾讯混元新一代旗舰模型 Hy4 preview 上线预览

腾讯混元新一代旗舰模型 Hy4 preview 已开放预览版,采用 770B 总参数与 49B 激活参数的稀疏架构,原生支持 100 万 token 上下文窗口。官方实测显示,端到端推理吞吐较上一代提高 31.8%,在代码编写、办公文档、游戏开发与科研计算四类真实生产力任务中均有明显增益。科研侧进展更受关注:分子动力学模拟效率提升至原先的 2 倍,并把三维 Blaschke-Lebesgue 体积下界这一悬置百年的几何难题推进到 0.41104。

来源:腾讯混元

谷歌发布视频生成模型 Gemini Omni 1.1 Flash,最高 4K 直出

谷歌发布视频生成模型 Gemini Omni 1.1 Flash,最高可直出 4K 成片。它支持从已有片段尾部续写,每次延长 10 秒、单条累计最长 40 秒,只需指定首尾帧即可完成平滑转场与运镜。分辨率覆盖 360p 到 4K 多档,360p 预览模式生成速度快 60%、成本仅三分之一,适合分镜快速迭代;另可挂载最长 3 秒参考视频锁定角色与场景一致性。按秒计费,720p 每秒 0.1 美元、4K 每秒 0.3 美元。

来源:IT之家

阿里通义千问推出海外AI办公平台 QwenWork

QwenWork是阿里通义千问面向海外市场推出的AI办公生产力平台,集成文档处理、表格分析与智能写作等能力,主打多语言协作与企业级工作流自动化。

来源:千问办公QwenWork
8月27日 周四

腾讯混元推出端侧翻译大模型 Hy-MT2-1.8B

腾讯混元最新端侧翻译引擎Hy-MT2的1.8B轻量版利用自研Sherry 1.25-bit量化加2-bit压缩方案,将原3.3GB体积的模型在几乎不损失翻译水准的前提下缩到可端侧部署的体积,实测翻译效果超越微软及豆包等商用接口。该模型与英特尔合作做了x86指令集级算子适配后,已接入B站直播的弹幕实时翻译管线,覆盖33个语种方向,单条弹幕从输入到输出仅耗时500到800毫秒。

来源:腾讯混元

智谱推出原生多模态模型GLM-5.3-Flash

作为GLM-5系列首个原生多模态产品,GLM-5.3-Flash在320B总参数架构下仅激活18B即完成推理。AA基准测试得分57,追平Claude Opus 4.8,而API调用成本仅约后者的2.5%。模型以线性与稀疏双重注意力交替运行削减长序列开销,视觉模块直接编入主干网络,具备自主编写代码、操控浏览器及理解图形界面能力。

来源:智谱

通义千问发布多模态MoE大模型Qwen3.8-Flash

Qwen3.8-Flash是阿里通义基于MoE混合专家架构打造的新模型,125B参数量下每个token仅路由激活6B。上下文窗口原生262K并支持YaRN外推至100万token。底层做了四项革新——GDN与QSA双路注意力、门控残差机制、N-gram词嵌入策略以及Muon训练优化器,把预填充吞吐推到上一代的8.6倍同时把训练花费砍到九分之一。商用API按每百万token计费,输入0.8元输出2.7元。

来源:千问大模型

谷歌推出语音转文本模型 Gemini 3.5 Transcribe

谷歌最新语音转写引擎Gemini 3.5 Transcribe主打”理解式转写”——能自动识别并剔除说话中的”嗯””呃”等语气词以及口误自我更正内容,输出可直接使用的干净文本。与上一代Chirp 3引擎对比,处理速度提高约70%,实时流式场景下词错率压到5.5%以内。模型覆盖85种语言,预录模式支持最多3人同时说话的声纹区分,目前已在Pixel 11手机的Gboard输入法Rambler功能中实装。

来源:IT之家
8月26日 周三

谷歌实验室推出实时协作Vibe Coding工具Play with Putty

Play with Putty是谷歌实验室推出的实时协作工具,主打Vibe Coding体验。用户无需编程基础,通过自然语言描述需求,AI即可自动生成代码并实时渲染为可用工具或网站;支持多人通过链接进入同一共享空间协作,修改即时同步。产品定位轻量消费级实验工具,目前处于排队等候阶段。

来源:AI工具箱

Stability AI 完成 7600 万美元 B 轮融资

Stability AI宣布完成7600万美元(约5.12亿元人民币)B轮融资,投资方包括EA、索尼音乐、环球音乐、华纳音乐及AMD风投部门,资金将用于创意产品开发、应用研究及专业服务扩展。CEO Prem Akkaraju表示投资者将带来专业知识与行业信誉,助力生成式AI赋能创意人士。

来源:IT之家

即梦AI推出影视内容厂牌「即梦片场」

即梦AI正式推出影视内容厂牌「即梦片场」,2026年8月至12月面向影视公司与AI创作者征集电影及剧集项目。电影设S、A两档扶持,剧集设S、A、B三档,提供算力、技术与发行全链路支持,联动番茄小说IP资源。同步推出创作者成长计划,优质作品最高可获10万元现金与百万宣推资源。

来源:即梦AI

爱诗科技推出实时全模态世界模型 PixVerse R2

爱诗科技发布实时全模态世界模型PixVerse R2技术报告。R2在PixVerse R1基础上探索实时世界模型持续Scaling路径,通过Omni Causal AR统一架构支持文本、参考图、音频、动作等多模态输入,实现边生成、边交互、边演化的持续世界运行。模型采用Block-sparse Attention将稀疏度提升至90%以上,Error Bank使长期亮度漂移下降约35.8%。

来源:爱诗科技
8月25日 周二

小红书开源统一语音生成与编辑模型 FireRedTTS3

小红书 FireRed 团队开源统一语音生成与编辑模型FireRedTTS3。模型基于 RedAE 语义增强连续表示与 LLM-DiT 架构,单一模型可实现 24 种语言及 21 种中文方言的零样本音色克隆、自然语言声音设计与指定区域精准语音编辑。模型在四个公开评测集上均取得最优成绩,为有声内容、游戏配音及品牌客服等场景提供高效解决方案。

来源:AI工具箱

RunningHub 首发上线阿里视频生成模型 Wan3.0:单次最长30秒,PPT一键转视频

RunningHub首发完成对阿里视频生成模型Wan3.0的全栈适配——单次生成最长 30 秒视频,支持文本、图片、音频、视频及 doc/ppt/pdf 等文档格式输入,可一键把 PPT 转成教学或营销视频。人物与场景一致性显著提升,RunningHub 旗下 rhTV、RHSTORY、ComfyUI 等生态已同步适配,覆盖影视、广告、电商等商用场景,用户无需本地部署即可按量调用。

来源:AI工具箱

LiblibAI 推出海外AI视频创作平台 Newtake:接入 Seedance 2.5,月付 $19 起

LiblibAI 面向海外市场推出 AI 视频创作平台Newtake,定位「导演工具」。平台基于无限画布与节点工作流,集成导演控制台、电影感灯光、多视角解析及纹理角色表等功能,通过角色一致性管理解决 AI 视频「变脸」痛点,已接入 Seedance 2.5、MiniMax H3 等模型。订阅月付 $19 起,免费用户每日登录可领 100 积分。

来源:AI工具箱
8月24日 周一

字节跳动整合AI生产力:TRAE、扣子并入豆包体系,本周内将推统一办公品牌”豆包工作”

字节跳动被曝完成AI生产力团队整合:TRAE Work扣子桌面端(Coze)与豆包大模型的工作场景能力合并,转为豆包品牌下产品线,统一向豆包产品负责人汇报;豆包大模型团队支持新业务。最快本周内将推出独立AI办公产品”豆包工作”作为字节AI办公统一品牌,整合后现有用户权益不受影响。

来源:IT之家

阿里通义万相视频大模型 Wan3.0 正式上线:单次生成30秒视频,首创支持办公文档直接转视频

阿里通义万相视频大模型Wan3.0正式上线,单次生成时长从此前的10秒级别跃升至30秒,并首创支持doc、xls、ppt、pdf、md等文档格式直接转视频——PPT上传就能变教学课件。模型落地短剧、影视、广告、文旅、音乐MV等场景;API按秒计费,480P/720P/1080P分别0.3/0.6/1.2元/秒,相比可灵3.0订阅制有更清晰的成本可控性。

来源:阿里云

中国电信天翼AI推出桌面级通用智能体助手TeleAgent

中国电信天翼AI于2026年8月21日正式推出桌面级通用智能体助手TeleAgent(星辰超级智能体),定位”AI办公搭子”,支持Windows 10(64位)及以上与macOS 13及以上系统。与普通AI”问一句答一句”不同,TeleAgent以”任务交付”为核心——自动完成文件整理、深度调研、文档写审、应用生成四大办公场景,用户下达指令即可获得直接可用的成果,默认”先列方案再执行”兼顾自动化与可控性,本地驻留+不强制上传的策略适合财务、商业机密等敏感场景。

来源:中国电信天翼AI
8月23日 周日

蚂蚁百灵开源Ling-3.0基座模型:6个训练节点权重全开放

蚂蚁百灵正式开源 Ling-3.0-tiny-base(总参7.9B/激活1.3B)与 Ling-3.0-flash-base(总参124B/激活5.1B)两个基座模型,并同步开放预训练、中期训练与WSM合并共6个训练节点权重,全部采用MIT许可证。官方基准显示tiny-base在HumanEval-Plus取得 79.27,领先Qwen3.5-9B-base的52.44;配套推理版Ling-3.0-tiny已上线OpenRouter。

来源:蚂蚁百灵inclusionAI

商汤开源SenseNova U1.5-8B-MoT正式版:Apache 2.0许可证

商汤科技开源原生统一多模态大模型 SenseNova U1.5-8B-MoT 正式版,许可证Apache 2.0。模型基于NEO-unify架构,无视觉编码器与VAE,原生支持4K输出、图像编辑与交错图文生成,官方说明其在指令遵循、文字排版、图像编辑等 六个 方面较Preview版全面升级,配套LoRA-8step加速权重同步开源。此前预览版体验可参考SenseNova U1.5-Lite-Preview

来源:商汤科技SenseTime

Mistral推出Agentic Search:多步检索将复杂文档准确率提升至86%

Mistral AI正式推出Mistral Agentic Search智能体搜索检索层,引入多步检索循环机制,为模型赋予search、open、navigate、read、grep等文档级操作工具。在FinanceBench金融文档基准测试中,基于368份平均约147页的SEC文件,完整agentic循环准确率从单次RAG的27%提升至86%,提升约3倍;p90延迟从255秒降至154秒,token消耗减少最高33.7%。该工具支持云端Studio/Vibe和本地Docker+Vespa部署。

来源:AI工具箱
8月22日 周六

xAI Grok Build 正式全量上线:覆盖网页与移动端,支持一句话生成应用

xAI 的 Grok Build 已结束早期测试,正式向所有套餐用户开放网页端、iOS 与 Android。用户在与 Grok 对话中用自然语言描述需求,即可实时生成并运行应用或小游戏;发布后可获得 grok.me 专属链接、富预览封面,并支持在 X 以互动卡片形式分享与 Remix 二次改造。

来源:AI工具箱

DeepSeek Harness 升级 0.1.1-rc.1,新增视觉模型 V4-Flash-Vision-Exp

DeepSeek 将开源工具链 DeepSeek Harness 升级至 0.1.1-rc.1 版本,在 V4-Flash 与 V4-Pro 基础上新增视觉模型体验版 DeepSeek-V4-Flash-Vision-Exp。前一日发布的 v0.1.0-rc.8 已支持原生图片请求与 /goal、/plan 等指令的图文混合输入,开发者通过 npm 升级即可让 Agent 直接“看图干活”,补全多模态处理闭环。

来源:AI工具箱

Adobe Firefly 音频生成工具全面上线:覆盖音乐、语音与音效

Adobe 的 Adobe Firefly 音频生成工具正式上线,支持在桌面与移动端创作商业安全级别的音乐、语音与音效。调查显示 32.7% 的受访创作者已在视频中使用 AI 生成音乐,43.2% 将法律版权风险视为主要障碍,38.9% 则担心授权费用,Firefly 的商用授权模式试图降低这些顾虑。

来源:AI工具箱
8月21日 周五

OpenAI开源Codex Harness:AI Agent底层执行框架,ARC-AGI-3成绩飙升近3倍

OpenAI开源AI Agent底层执行框架Codex Harness,负责任务理解、工具调用、沙箱执行与人类审批等完整执行循环,支持CLI、SDK与app-server三大接入方式。官方基准显示,仅优化Harness层即可让GPT-5.6 Sol的ARC-AGI-3得分从13.3%跃升至38.3%,Token消耗减少约6倍。

来源:OpenAI

阿里通义发布Qwen-UI-Agent:真机训练的GUI智能体基座,八项基准全面领先

阿里通义推出GUI智能体基座模型Qwen-UI-Agent,基于100多台真机与150多个应用训练,支持GUI与命令行混合执行和100步以上长程任务,在MobileWorld、OSWorld、WebArena等八项基准上全面超越或持平GPT-5.6、Claude Opus等旗舰模型。

来源:通义实验室

DeepSeek Harness重磅更新:多模态支持全面上线,/goal与/plan命令可带图

DeepSeek Harness在发布一周内迎来重大升级,正式加入多模态能力。模型适配器现在可启用原生图片请求,/goal、/plan等指令支持直接带图发送,@引用体验也同步优化。这一更新让智能体在视觉任务中的可用性大幅提升,也被外界解读为DeepSeek V4视觉版可能临近的信号。

来源:AI工具箱

MiniMax Design发布:基于H3多模态视频模型,自然语言即可指挥创作

MiniMax推出商业内容生产平台MiniMax Design,基于MiniMax H3原生多模态视频模型,将视频创作从”操作像素”推进到”操作语义”阶段。用户只需用自然语言描述意图,系统即可自动拆解任务并调用模型完成生成,目标是把前沿模型能力直接转化为商业视频生产力。

来源:AI工具箱

Meta推出Mac版AI助手:支持屏幕共享与跨应用语音输入

Meta正式发布Mac版Meta AI助手桌面应用,支持共享屏幕窗口后由AI基于画面内容提供建议、问答与生成,同时支持跨应用语音输入。此举意在将AI聊天机器人升级为生产力助手,与Google Gemini、ChatGPT和Claude的桌面布局展开正面竞争。

来源:AI工具箱
8月20日 周四

Anthropic延长Claude Code额度50%加成至8月31日,探索永久标准方案

Anthropic宣布将AI编程助手Claude Code每周使用额度50%临时加成从原定8月19日截止延长至2026年8月31日,并正探索将其转为订阅配额的永久标准方案。该加成自7月19日起面向Pro、Max、Team及席位制Enterprise用户推出,以应对开发者对Claude Code日益增长的使用需求。Anthropic表示若反馈持续积极,50%额度提升有望成为长期默认配置。

来源:AI工具箱

Anthropic预告Claude Code将整合/design命令,支持编码前先画UI原型

Anthropic产品设计师Nate Parrott于8月18日在X平台预告,Claude Code即将整合全新/design命令,开发者可在写代码前于终端或桌面版中创建交互式设计模型。输入”/design a few options for {feature}”即可生成多个UI方案供选择,将设计探索前置到编码流程中,提升从设计到开发的整体效率。这是Anthropic持续扩展Claude Code生态的又一举措。

来源:IT之家

微信灰度上线AI总结、AI点评、AI修图三大功能

微信iOS版虽未更新版本号,但通过灰度测试悄然上线AI总结、AI点评和AI修图三大功能,覆盖公众号文章总结、朋友圈点评生成和图片智能编辑场景。AI总结可提取公众号文章要点,AI点评为朋友圈内容生成互动评论,AI修图支持图片智能处理。此外Windows/Mac端4.1.13正式版同步新增合并发图和表情动态预览。此前微信已灰度测试原生AI助手小微助手,AI入口持续扩张。

来源:IT之家
8月19日 周三

Stripe被曝超70亿美元收购OpenRouter,后者同步下调GPT-5.6 Sol调用费

支付巨头Stripe被曝将以超70亿美元收购模型路由平台OpenRouter,后者全球用户达800万,B轮估值约13亿美元。几乎同时,GPT-5.6 Sol在OpenRouter的调用费已下调50%,输入降至2.5美元/百万tokens,输出降至15美元/百万tokens。

来源:IT之家

腾讯云落地马来西亚首个云区域,WorkBuddy企业版同步亮相

腾讯云宣布在马来西亚柔佛州设立首个云区域,首期规划3个可用区,并联合当地高校与企业深化AI人才培养。同时,腾讯AI原生办公智能体WorkBuddy企业版也同步亮相,具备超百种办公技能,覆盖消息、文档、表格、邮件与会议等场景。

来源:IT之家

微软Copilot Notebooks扩展支持Markdown等三种文本格式

微软更新Microsoft 365 Copilot生态下的Copilot Notebooks应用,新增支持Markdown、纯文本和富文本三种格式,进一步强化了AI资料整理与分析能力,方便用户在不同格式间切换编辑和沉淀知识。

来源:IT之家
8月18日 周二

微信密集新增AI入口至16个,灰度测试小微助手

微信近期密集上线AI能力,灰度测试原生AI助手小微,新增3个高频场景入口,使微信内AI入口总数达到16个。新增功能包括:公众号常看的号页面新增AI一键文章总结、长按朋友圈文字可唤起AI点评、聊天看图新增AI处理支持美化与信息提取,覆盖从图片识别到转账提醒的全链路场景,被视为微信从工具型应用向AI原生入口升级的关键信号。

来源:AI工具箱

昆仑万维发布Mureka V9.5:AI音乐转向人情味创作

昆仑万维正式发布AI音乐生成模型Mureka V9.5,是V9系列的最新升级版本。相较前代的高音量、高饱和度强刺激路线,新版转向克制、留白、自然的创作风格,重点强化消除机械感与增添人味儿。核心升级在于深化自研MusiCoT音乐思维链框架——不再直接生成音频波形,而是以思维链推理驱动分步合成,使歌曲在结构、过渡与耐听度上明显改善。

来源:AI工具箱
8月17日 周一

Stripe 超 70 亿美元收购 OpenRouter

彭博社称支付巨头 Stripe 已敲定对 AI 模型聚合平台 OpenRouter 的收购,交易金额超过 70 亿美元,约为后者 B 轮 13 亿美元估值的 5 倍以上。OpenRouter 自称平台全球用户达 800 万,可提供逾 400 种模型统一调用入口。

来源:IT之家 / 彭博社
8月15日 周六

腾讯 QQ Bot 接入 DeepSeek Harness,支持单聊与群聊

腾讯 QQ 官方宣布 QQ Bot 机器人接入 DeepSeek Harness 智能体框架及官方插件,接入仅需 3 步,支持单聊和群聊场景下的 AI 智能体能力。DeepSeek Harness 是深度求索推出的智能体开发框架,可帮助开发者快速构建具备工具调用、代码执行等能力的 AI Agent。

来源:IT之家 / 腾讯QQ
8月14日 周五

小红书开源多模态大模型 dots3.note preview

小红书 dots 模型实验室开源 dots3.note preview,为 dots3 系列首个开源版本。模型总参数 280B、激活 16B 的 MoE 架构,支持 512K 超长上下文,原生具备文本、视觉与语音全模态理解能力,针对复杂推理、Agent 任务与多模态感知场景优化。在多项基准测试中可比肩参数数倍的大模型,并在昇腾 Atlas 800A3 / 900A3 上完成 0Day 适配(基于 vLLM-Ascend)。

来源:Hugging Face

MiniMax 开源音乐生成模型 MiniMax-Music3

MiniMax 开源音乐生成大模型 MiniMax-Music3,支持最长 5 分钟歌曲生成并可同时输出歌词。采用 8B 全局模型 + 0.6B 局部模型的分层架构,全局层负责长程语义与段落结构,局部层恢复细粒度声学细节;输出 32kHz 立体声 WAV,可保持主题、节奏、歌声音色与编曲推进,覆盖前奏、主歌、副歌、桥段等完整曲式结构。

来源:IT之家

智谱推出最强编程开源大模型 GLM-5.3

智谱正式发布 GLM-5.3 开源版本,基座未变、通过后训练 Scaling 显著抬高智能上界,已成为当前编程能力最强的开源大模型。在 Terminal Bench 3.0 等多项基准测试中取得开源第一,模型同时涌现出强大网络安全能力,在代码审查与漏洞发现任务中表现突出。智谱联合多家安全团队累计发现 2,436 个漏洞,并启动”开源的盾”生态计划。

来源:智谱
8月13日 周四

谷歌推出主力模型 Gemini 3.7 Flash,主打编程与 Agent

Google 推出 Gemini 3.7 Flash,专为编程与 Agent 场景设计。模型在软件工程、知识工作及网页开发等任务上较上一代大幅提升,上下文窗口扩展至 100 万 token。即日起至 2026 年底首发优惠为原 3.6 Flash 的一半:输入 \$0.75 / 百万 token,输出 \$3.75 / 百万 token。深度集成 Gemini for Workspace,工具调用与多步任务编排能力同步升级。

来源:IT之家

DeepSeek 同日发布 V4-Pro 正式版与开源智能体框架 Harness

DeepSeek 在 8 月 13 日晚同步推出两项重要发布:正式版 DeepSeek-V4-Pro(Agent 能力显著增强,在 Terminal Bench、DeepSWE 等评测集上表现优异,API 原生支持 OpenAI Responses API 格式),以及开源智能体框架 DeepSeek Harness(v0.1 开发者预览,MIT 协议)。Harness 采用”一切皆插件”的 Cordis 架构,模型、工具、会话、UI 均可自由替换,发布半日 GitHub Star 数突破 3 万,对标 OpenAI Codex 与 Anthropic Claude Code。

来源:DeepSeek 官方
8月11日 周二

Lightricks 开源音视频世界模型 LTX-2.5

Lightricks 发布开源权重世界模型 LTX-2.5(22B),支持文本、图像、视频输入生成同步音画。重磅更新包括:全新 Diffusion Video Decoder(改善高速运动场景伪影)、Diffusion Fidelity Rendering(按场景复杂度分配算力)、原生多镜头切换(一次生成连贯分镜)、定制 Gemma 4 12B 文本编码器 + Prompt Enhancer、可选 Duration Predictor(按动作自动决定时长)。官方盲测胜率 67%,超过 Seedance 2.5(65%)与 MiniMax H3(50%)。

来源:LTX 官方

腾讯推出 Windows 桌面美化工具小鹅桌面

腾讯正式上线 Windows 桌面美化与轻量效率工具 小鹅桌面,永久免费、无广告。核心功能:百万级 4K 动态/静态壁纸 + 自动轮播、头像与桌面小组件库、一键整理桌面、内置轻量 AI 对话窗口(支持待办备忘、截止日期识别与简单总结)、本地 + 云端文件搜索。定位”个人美化与日常效率”,与 WorkBuddy 等办公 Agent 错位互补。

来源:腾讯
8月10日 周一

B 站开源零样本语音克隆模型 IndexTTS-2.5

B 站 IndexSpeechTeam 开源零样本多语种 TTS 模型 IndexTTS-2.5(0.8B),支持中文、英文、日文、西班牙文、阿拉伯文五语种的语音克隆与跨语种迁移。重构推理架构后推理速度提升 2.28 倍(RTF 0.2065@4090 bf16),新增 0.5–2.0 倍语速控制、拼音/CMU/假名发音控制、4 路径情感控制(参考音频 / 八维向量 / 文本推断 / 描述文本)。采用 Bilibili Model License 开源,配套 WebUI(7860 端口)与 vLLM 部署方案。

来源:GitHub / IndexTeam
7月12日 周六

月之暗面Kimi正式发布k2模型,具备超强代码和 Agent 能力

月之暗面正式推出基于MoE架构的新一代基础大模型k2,总参数规模达1T,激活参数32B,支持最长128k tokens上下文处理,具备强大的代码生成与智能体(Agent)能力。模型原生支持ToolCalls、JSON/Partial输出及联网功能,但暂不支持视觉输入。定价方面,输入费用为¥1.00/百万tokens,输出¥4.00/百万,缓存命中¥16.00/百万,在多个性能指标上全面领先当前主流开源模型。

来源:AI工具箱

拍我AI(PixVerse)上线多关键帧生成功能,从“片段”迈向“故事性表达”

拍我AI(PixVerse)全新上线“多关键帧生成”功能,支持用户上传最多7张图片,基于首尾帧模式生成最长30秒的视频内容,实现人物动作、场景变化与镜头语言的自然过渡。该功能显著提升了短剧、广告、故事类视频的生成效率,标志着AI视频从静态片段向完整叙事的跃迁。

来源:爱诗科技AIsphere
7月11日 周五

欧盟《通用人工智能行为准则》8月2日实施

欧盟公布最终版《通用人工智能行为准则》,将于8月2日正式生效。该准则聚焦安全、透明与版权保护三大方面,由专家联合多方制定。企业可自愿签署以减轻合规负担,现有模型有2年调整期,新模型为1年。

来源:IT之家

墨刀AI上线”30秒生成原型图”功能

墨刀AI推出全新原型自动生成能力,支持输入文字描述、草图或截图,30秒内即可产出可交付界面。用户可通过多轮对话优化设计,并自动生成产品文档与页面逻辑,面向产品经理和设计师提供零门槛体验。

来源:墨刀

微软发布高性能端侧模型Phi-4-mini-flash-reasoning

微软推出专为端侧优化的AI模型Phi-4-mini-flash-reasoning。该模型在数学与逻辑推理任务上表现突出,推理吞吐量提升10倍,延迟降低至三分之一。现已上线Azure AI Foundry等平台。

来源:IT之家
7月10日 周四

马斯克发布Grok 4,处理学术问题达到博士级别

马斯克旗下xAI发布新一代大模型Grok 4,推理能力较前代提升10倍,在多项基准测试中超越现有模型,达到”博士后水平”。Grok 4支持工具调用、语音交互、多模态任务,并在ARC-AGI等高难度测试中刷新纪录。

来源:机器之心

办公小浣熊·桌面版全新上线!

商汤科技推出”办公小浣熊”桌面版,支持Windows和Mac平台,用户无需浏览器即可一键唤醒AI助手,实现任务拆解、数据分析、图表生成等办公功能。老用户可同步历史内容。

来源:商汤小浣熊

智谱Z.ai推出实验性大模型GLM-Experimental

智谱AI推出全新实验模型GLM-Experimental,主打”AI Presentation”功能,可一键生成网页版PPT,支持多种风格与互动效果。用户只需输入简单Prompt,模型可自动生成内容、设计排版,实现弹幕、动画等高级效果。

来源:AI工具箱

Perplexity推出AI浏览器——Comet

Perplexity发布AI浏览器Comet,主打”从浏览到思考”,整合网页解释、任务执行等功能,成为用户的”思考伙伴”。Comet目前仅向高价订阅用户开放。

来源:AI工具箱

抖音快手前高管创业,上线AI图片工具KIRA

由抖音、TikTok、快手前核心成员创立的AI图片生成工具KIRA正式亮相。产品由ILLA Cloud孵化,支持一键替换/移除背景、修补、画质增强、扩图等操作,并具备AI生成图片能力。创始团队包括曾任抖音 & TikTok研发、快手孵化业务大前端负责人陈龙博,及抖音、快手多项战略项目设计负责人吴晓松。

来源:AI工具箱
© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章

没有相关内容!