Type: concept
Confidence: 0.70
Created: 2026-04-20
Updated: 2026-04-20
Tags: multimodalAIAI工程

多模态模型

概述

能够处理和生成多种模态(文本、图像、音频等)数据的 AI 模型。

关键内容

  1. GPT-4:支持文本和图像输入,实现跨模态理解和推理。
  2. CLIP:建立文本和视觉的统一表示空间,实现图文对齐。
  3. DALL-E:从文本生成图像,实现跨模态生成。

来源

相关