Skip to content

选择模型

先明确任务,再在模型广场中比较当前分组可见的模型。

选择维度

  • 质量:是否需要复杂推理、代码或专业领域能力。
  • 速度:交互场景优先低延迟,批处理可接受更慢模型。
  • 上下文:输入文档与历史消息是否接近模型上限。
  • 模态:是否需要图片、音频或结构化输出。
  • 费用:比较输入、输出及特殊计费项。
  • 数据边界:数据是否必须留在校内或指定环境。

推荐流程

  1. 用 20–50 条有代表性的真实任务建立测试集。
  2. 在同一提示词和参数下比较候选模型。
  3. 同时记录正确率、人工评分、延迟、Token 和费用。
  4. 为高风险任务加入人工复核和失败回退。
  5. 上线后持续抽样,不把一次评测当作永久结论。

模型名称和供应商不是数据合规结论。敏感数据应使用管理员明确指定的分组和模型。