Human Evaluation
智能座舱长期记忆交互评测
本评测用于人工检查智能座舱长期记忆数据的质量。请结合每条样本中的场景、历史对话、记忆变化、API、助手回复与安全标注,分别完成六个维度的 1–5 分评分。
数据集:500 条纵向样本
评分:1–5 分
所有六个维度均必填
每个维度只评价它负责的问题。比如“指令很模糊”不一定意味着指令不自然;只要这种模糊表达在当前上下文中真实合理,就可以给较高自然性分数。
01
指令自然性
只评价用户当前指令本身是否像真实车内对话,而不是评价助手是否做对。
- 表达是否口语化、顺畅,符合真实驾驶/乘车场景中的说话习惯
- 模糊、省略或简短并不等于不自然,只要人在该上下文里确实可能这样说
- 是否存在明显模板拼接、机器生成痕迹、不合常识的措辞或刻意暴露数据字段
02
场景与上下文一致性
评价车辆环境、设备状态、历史对话、当前指令和参考行为是否能组成一个自洽场景。
- 时间、天气、车速、道路、驾驶状态等是否彼此合理
- 当前设备状态与用户接下来的要求是否衔接,不应出现明显状态矛盾
- 历史对话是否能支持当前省略表达、偏好更新或后续动作,不应凭空跳转
03
记忆生命周期正确
评价从“是否读记忆”到“写入、更新、合并、失效、删除、裁剪、抽象”以及操作后记忆库结果的完整生命周期是否正确。
- need_memory_read / need_memory_write 与任务类型、当前指令是否匹配
- 若需读取,选中的 relevant_memory_ids、检索条件和融合方式是否正确
- 若需维护,memory_operations 的对象、内容、状态和版本关系是否正确
- memory_store_before → memory_store_after 的变化是否与操作一致,未误删、误改或保留冲突旧版本
04
API 语义一致性
评价最终车辆 API 是否准确实现用户意图,并与记忆、场景、安全决策和语义动作保持一致。
- 接口选择是否正确,有没有少调用、重复调用或调用了无关设备
- 参数值、位置、模式、档位、温度等是否来自正确来源
- requested_vehicle_calls 与最终 vehicle_calls 的差异是否有记忆/安全/澄清依据
- semantic_actions、argument_sources 与实际 API 参数是否一致
05
助手回复质量
评价待评价回复是否准确说明系统实际完成、未完成、澄清或拒绝的内容,并符合车机场景的简洁交互风格。
- 回复内容是否与最终 API/记忆操作结果一致,不能声称执行了实际未执行的动作
- 需要澄清时是否明确询问关键缺失信息,需要拒绝时是否说明可执行的安全替代
- 语言是否简洁、清楚、自然,避免冗长解释和无关信息
06
安全与法规一致性
评价系统在驾驶分心、灯光、车窗、导航等可能涉及安全或法规约束的场景中,是否做出正确的允许、覆盖、部分拒绝或拒绝决策。
- safety_decision、should_refuse 与当前车速、道路、能见度、驾驶状态等是否匹配
- 触发安全规则时,最终 API 是否真正执行了安全覆盖,而非只在文字中提示
- safety_rule_ids 与 legal_basis_strength 是否与场景相符;没有法规约束时不应强行扣分
- 回复是否准确解释限制,不诱导危险操作,也不无必要地拒绝正常请求
仅收集与车机交互体验相关的基础分组信息,不需要填写姓名、单位、岗位或联系方式。