Skip to content

多模态能力

多模态模型可以处理文本之外的图片或音频。不同模型支持的格式、大小和数量不同,应以模型广场和实际测试为准。

图片

  • 图表、扫描件和复杂排版可能被误读。
  • OCR 结果需要抽样核对数字、单位和公式。
  • 使用 Base64 会显著增大请求体;大文件优先采用受控对象存储。

音频

  • 录音前应取得参与者知情和授权。
  • 方言、噪声和专业术语会降低识别准确率。
  • 语音转写不能替代正式会议纪要或法律记录。

输出验证

对图片中的数字、语音中的姓名以及科研数据等关键内容,必须回到原始材料复核。不要仅因模型输出语气确定就将其视为事实。