AI模型

汇集最全的AI模型资源,包括通用大模型、垂直领域模型及实用工具,提供使用教程、测评与更新动态,让你快速掌握AI模型应用。

Qwen3.7-Plus – 阿里通义推出的多模态智能体与视觉语言大模型

Qwen3.7-Plus是阿里通义千问推出的新一代多模态智能体大模型,支持视觉、文本、视频与GUI统一处理,具备视觉推理、代码生成与工具调用能力,适用于复杂软件工...

Qwen-VLA – 阿里通义推出的通用视觉语言动作具身智能模型

Qwen-VLA是阿里通义实验室推出的通用视觉-语言-动作模型,支持机器人操作、视觉语言导航、轨迹预测和跨本体控制。模型基于Qwen3.5-4B与DiT动作解码器构建,具...

ControlFoley – 小米开源的可控视频音效生成与多模态V2A模型

ControlFoley是小米开源的可控视频音效生成模型,支持TV2A、TC-V2A与AC-V2A多任务视频配音,通过文本、视频与参考音频实现可控音频生成,适用于短视频创作、...

MiniMax M3 – MiniMax推出的百万上下文多模态智能体大模型

MiniMax M3是MiniMax推出的新一代大语言模型,支持1M超长上下文、多模态图像与视频输入及Agent智能体任务执行能力,覆盖AI编程、代码生成、长文档分析、会议...

Qwen-Image-Bench – 阿里通义千问推出的文生图模型评测基准

Qwen-Image-Bench是阿里通义千问团队推出的文生图模型评测基准,支持中英双语提示词、多维度图像生成评估与自动化评分,覆盖文本渲染、语义一致性、创意生成...

Claude Opus 4.8 – Anthropic发布旗舰级Agentic大语言模型与推理系统

Claude Opus 4.8是Anthropic于2026年5月28日发布的旗舰级大语言模型,支持1M超长上下文、agentic coding与多智能体工作流,在SWE-Bench Pro达69.2%、OSWorld...

Wall-OSS-0.5 – 自变量机器人推出的视觉语言动作具身模型

Wall-OSS-0.5是X Square Robot推出的视觉语言动作(VLA)具身智能模型,基于多模态大模型与机器人控制系统融合构建,支持零样本机器人操作、跨形态任务泛化与...

MAI-Image-2.5 – 微软推出的AI商业图像生成模型

MAI-Image-2.5是微软MAI Superintelligence Team推出的AI图像生成模型,支持商业海报、品牌视觉、产品包装、电商主图与复杂场景生成。模型强化文字渲染、空间...

Keye-VL-2.0-30B-A3B – 快手推出的长视频多模态理解模型

Keye-VL-2.0-30B-A3B 是快手 Keye 团队发布的多模态大语言模型,支持 256K 超长上下文、视频理解、时序定位与 Agent 协作能力,可用于长视频分析、AI视频理解...

MiMo-V2.5 – 小米MiMo全模态Agent大模型系列(1M上下文)

MiMo-V2.5是小米MiMo推出的全模态Agent大模型系列,支持文本、图像、音频与视频统一理解与生成,具备1M tokens超长上下文与MoE混合专家架构,可用于复杂软件...
1 14 15 16 17 18 32