Qwen-VLA – 阿里通义推出的通用视觉语言动作具身智能模型
Qwen-VLA是阿里通义实验室推出的通用视觉-语言-动作模型,支持机器人操作、视觉语言导航、轨迹预测和跨本体控制。模型基于Qwen3.5-4B与DiT动作解码器构建,具...
ControlFoley – 小米开源的可控视频音效生成与多模态V2A模型
ControlFoley是小米开源的可控视频音效生成模型,支持TV2A、TC-V2A与AC-V2A多任务视频配音,通过文本、视频与参考音频实现可控音频生成,适用于短视频创作、...
MiniMax M3 – MiniMax推出的百万上下文多模态智能体大模型
MiniMax M3是MiniMax推出的新一代大语言模型,支持1M超长上下文、多模态图像与视频输入及Agent智能体任务执行能力,覆盖AI编程、代码生成、长文档分析、会议...
PilotDeck – 清华联合面壁智能开源的AI Agent操作系统与WorkSpace多智能体平台
PilotDeck是清华大学THUNLP、面壁智能与OpenBMB联合开源的AI Agent操作系统与WorkSpace多智能体平台,支持工作舱任务隔离、白盒记忆、智能路由与Always-on自...
Qwen-Image-Bench – 阿里通义千问推出的文生图模型评测基准
Qwen-Image-Bench是阿里通义千问团队推出的文生图模型评测基准,支持中英双语提示词、多维度图像生成评估与自动化评分,覆盖文本渲染、语义一致性、创意生成...
Claude Opus 4.8 – Anthropic发布旗舰级Agentic大语言模型与推理系统
Claude Opus 4.8是Anthropic于2026年5月28日发布的旗舰级大语言模型,支持1M超长上下文、agentic coding与多智能体工作流,在SWE-Bench Pro达69.2%、OSWorld...
Wall-OSS-0.5 – 自变量机器人推出的视觉语言动作具身模型
Wall-OSS-0.5是X Square Robot推出的视觉语言动作(VLA)具身智能模型,基于多模态大模型与机器人控制系统融合构建,支持零样本机器人操作、跨形态任务泛化与...
代号Craft – 腾讯游戏推出的AI游戏创作平台
代号Craft是腾讯游戏生态发展部推出的AI游戏创作平台,支持通过自然语言快速生成2D与3D游戏原型,内置AIGC工具链、20,000+预制资产库及Unity导出能力,适用于...
Runway MCP – Runway推出的AI视频生成与MCP Agent工作流连接服务器
Runway MCP 是 Runway 推出的 MCP Server 工具,通过 MCP 协议将AI视频生成能力接入Claude、ChatGPT、Cursor等AI Agent,实现对话式视频生成与图像创作。支持...
MAI-Image-2.5 – 微软推出的AI商业图像生成模型
MAI-Image-2.5是微软MAI Superintelligence Team推出的AI图像生成模型,支持商业海报、品牌视觉、产品包装、电商主图与复杂场景生成。模型强化文字渲染、空间...

浙公网安备33010202004812号