AI模型

汇集最全的AI模型资源,包括通用大模型、垂直领域模型及实用工具,提供使用教程、测评与更新动态,让你快速掌握AI模型应用。

OvisOCR2 – 阿里ATH-MaaS团队推出的端到端文档OCR解析模型

OvisOCR2是阿里ATH-MaaS团队推出的端到端文档OCR解析模型,支持文本识别、表格解析、公式识别和Markdown结构化输出,适用于智能文档处理、知识库建设、论文解...

BigMac – 小红书开源的多模态大模型流水并行训练框架

BigMac是小红书Dots Infra团队于2026年开源的多模态大模型训练框架,采用Dependency-safe Nested Pipeline技术优化流水并行训练效率与显存占用。BigMac支持视...

MAI-Voice-2-Flash – 微软推出的低延迟语音合成模型

MAI-Voice-2-Flash是微软AI推出的低延迟语音合成模型,支持AI语音生成、多语言语音合成、实时语音助手、智能体和客服场景。模型支持15种语言及18个地区设置,...

MAI-Image-2.5-Pro – 微软推出的AI图像生成与编辑模型

MAI-Image-2.5-Pro是微软AI推出的图像生成与编辑模型,支持AI图像生成、图片编辑、多语言文字渲染和企业级视觉创作。该模型可用于AI绘画、商业设计、内容制作...

FLUX 3 – Black Forest Labs推出的多模态AI基础模型

FLUX 3是Black Forest Labs发布的多模态AI基础模型,支持图像生成、视频生成、原生音频生成及动作预测扩展能力。该模型采用统一多模态架构,面向AI视频制作、...

SenseNova U1 Pro – 商汤科技推出的原生多模态智能体设计模型

SenseNova U1 Pro是商汤科技推出的原生多模态AI模型,支持图像生成、智能设计、信息图制作和复杂视觉任务处理。本文介绍SenseNova U1 Pro功能特点、技术架构...

Qwen-Image-3.0 – 阿里通义千问推出的AI图像生成模型

Qwen-Image-3.0是阿里巴巴通义千问团队推出的AI图像生成模型,支持文本生成图片、图像编辑、复杂版面设计和多语言文字渲染。模型面向电商设计、海报制作、教...

Mage-Flow – 微软开源的AI图像生成与编辑模型

Mage-Flow是微软推出的AI图像生成与编辑模型,支持文本生成图像、图像编辑和高分辨率视觉创作。该模型采用扩散架构,适用于AI绘画、电商设计、广告素材制作和...

Gemini 3.5 Flash Cyber – 谷歌安全智能体漏洞分析模型

Gemini 3.5 Flash Cyber是Google DeepMind面向网络安全场景推出的AI模型,目前仅向政府机构和审核通过的可信合作伙伴开放有限访问试点,支持漏洞分析、安全研...

Gemini 3.5 Flash-Lite – 谷歌推出的轻量化多模态模型

Gemini 3.5 Flash-Lite是谷歌推出的轻量化多模态AI模型,支持文本、图片、音频、视频理解及API调用,具备低延迟、高吞吐和长上下文处理能力,适用于智能体、...
1 6 7 8 9 10 32