设计、迭代智能座舱场景下的 System Prompt、Few-shot 样本和 Chain-of-Thought 模板,通过 A/B 实验量化 Prompt 修改对 Agent 指令遵循率、回复质量的影响,形成可复用的 Prompt 设计规范;
研究并优化多轮对话场景下的上下文管理策略,包括对话历史压缩、关键信息摘要、Memory 写入/检索机制,解决长对话中的 Context Pollution 和信息损失问题,降低无效 Token 占用;
搭建和维护 Agent 自动化评测 Harness,设计覆盖驾车典型场景的测试集(导航、音乐、控车、闲聊等),实现 Prompt/Context 变更的快速回归,输出可量化的评测报告;
从线上日志中挖掘 Agent 失败样本,归因 Prompt 歧义、Context 截断、Tool Call 错误等根因,维护 Bad Case 库,驱动持续迭代。