Skip to main content

1. 概述

多模态模型是能够同时处理多种模态信息(文本、图像、音频、视频)的大语言模型。SiliconFlow 提供了多个支持不同模态组合的强大模型,能够:
  1. 视觉理解:理解图片内容、OCR、图像描述
  2. 视频分析:提取视频帧、理解视频内容、动作识别
  3. 音频处理:语音识别、音频内容分析
  4. 多模态融合:同时处理多种媒体类型的综合分析

2. 支持模型概览

通过模型广场查看当前支持的多模态模型列表。 支持的模型可能发生调整,请以平台实际展示为准。

3. 使用方式

所有多模态模型都通过 /chat/completions 接口调用,使用标准化的 messages 格式,其中 content 可以包含不同类型的内容部分。

3.1 基本消息格式

3.2 通用参数说明

图像参数 (image_url)

  • url: 图像 URL 或 base64 编码数据,DeepSeek-OCR 还支持 PDF URL 或 base64 编码数据
  • detail: 细节级别 (auto, low, high)

视频参数 (video_url)

  • url: 视频 URL 或 base64 编码数据
  • detail: 细节级别 (auto, low, high)
  • max_frames: 最大提取帧数
  • fps: 每秒提取帧数,最终帧数为 min(fps × T, max_frames)

音频参数 (audio_url)

  • url: 音频 URL 或 base64 编码数据

4. 使用示例

4.1 视觉理解

图像分析

多图对比

PDF OCR

DeepSeek-OCR 还支持 PDF URL 或 base64 编码数据。 DeepSeek-OCR 支持多种场景的提示词:

4.2 视频理解

基础视频分析

多模态分析(视频 + 图片)

4.3 音频理解

音频内容分析

4.4 全模态分析

音视频综合分析

5. Python SDK 使用示例

5.1 视觉识别

5.2 视频分析

5.3 音频理解

6. PaddleOCR 客户端使用方法

6.1 CLI 调用

可通过 --vl_rec_backend 指定后端类型(vllm-server 或 sglang-server),通过 --vl_rec_server_url 指定服务地址,例如:
此外,可通过 --vl_rec_api_model_name 指定服务使用的模型名称,--vl_rec_api_key 指定鉴权使用的 API key。示例如下: 硅基流动平台:

6.2 Python API 调用

创建 PaddleOCRVL 对象时传入 vl_rec_backendvl_rec_server_url 参数,分别指定后端类型和服务地址:
此外,可通过 vl_rec_api_model_name 指定服务使用的模型名称,vl_rec_api_key 指定鉴权使用的 API key 硅基流动平台:

7. 计费说明

7.1 视觉输入计费

不同模型的视觉内容转换方式不同。下表对比展示核心规则与计费口径: 说明:
  • h,w 为最终用于计费的像素尺寸;表中 token 为视觉输入侧的估算,实际账单以请求时的最终转换结果为准。

7.2 视频输入计费

视频内容根据提取的帧数转换为 tokens:
  • 最终帧数 = min(fps × 视频时长, max_frames)
  • 每帧图像按对应视觉模型的标准转换

7.3 音频输入计费

音频内容转换为 tokens 进行计费,对于 Qwen3 omni 多模态模型,输入音频每秒对应 13 个 token, 如 22.5s 音频对应 292 个 token。

8. 最佳实践

8.1 性能优化

  1. 视频时长控制:建议 30 秒内以获得最佳分析效果
  2. 帧数选择max_frames=8-16fps=1-2 通常足够
  3. 图像尺寸:根据模型推荐尺寸进行预处理

8.2 使用建议

  1. 逐步分析:复杂任务分解为多个简单步骤
  2. 多模态组合:充分利用不同类型媒体的优势
  3. 错误处理:检查媒体文件可访问性和格式兼容性

8.3 常见问题

Q: 文件大小限制? A: 建议音频视频文件保持适中大小,超大文件可能影响性能 Q: 可以同时处理多少个媒体文件? A: 可以在同一请求中包含多个媒体 URL,但建议控制总体数据量 Q: 帧提取策略? A: 对于长视频,合理设置fpsmax_frames参数以获得最优的分析效果和成本平衡