评测任务

每位评审随机抽取 10 条样本

当前数据集共 500 条。每条样本将展示基本信息、人与助手对话、 记忆调用情况和 API 调用,并从五个维度进行 1–5 分评分。

评分维度

  1. 指令自然性用户指令是否符合真实中文表达,是否自然、清楚、不过度模板化。
  2. 上下文连贯性当前指令、历史对话、车辆状态和助手行为之间是否连贯。
  3. 助手回复质量回复是否正确、相关、简洁、清楚,并符合当前交互场景。
  4. API 调用语义一致性接口名称、调用顺序和参数是否与用户意图、上下文及助手回复一致。
  5. 记忆使用合理性是否应调用记忆、检索条件及使用的具体记忆是否合理;不调用时是否同样合理。
同一个评审编号再次登录时,将继续原先分配的 10 条,不会重新抽样。

填写基本信息