Raina测试学习指南Raina测试学习指南
导读
面试题
对话式面试题
AI 测试教程
软件测试教程
🌍 知识星球
学习交流群
  • Raina测试工具集
  • Raina常用网站&工具合集
  • 小红书
  • B站
  • 作者介绍
导读
面试题
对话式面试题
AI 测试教程
软件测试教程
🌍 知识星球
学习交流群
  • Raina测试工具集
  • Raina常用网站&工具合集
  • 小红书
  • B站
  • 作者介绍
  • 基础测试对话

    • 测试基础理论
    • 测试用例设计
    • 功能测试
    • 接口测试
    • 自动化测试
    • 性能测试
    • 安全测试
    • 移动端与兼容性测试
    • 测试管理与工程实践
    • 综合与开放题
    • 数据库与数据测试
    • Linux 与测试环境
    • 微服务与分布式系统
    • Web 前端专项
    • DevOps 与 CI/CD
    • 业务领域专项
    • 测试工具与效率
    • 质量度量与测试策略
    • 软技能与职业发展
    • 进阶综合题
    • 网络与 HTTP 协议(高频)
    • SQL 与数据库基础(高频)
    • 自动化落地细节(高频)
    • 缺陷与质量过程(高频)
    • 经典业务 / 场景设计题(高频)
    • Web / App 实战补充(高频)
    • 接口与联调实战(高频)
    • 性能与稳定性补充(高频)
    • 编程与工具基础(高频)
    • 行为面试与综合高频
  • AI 测试对话

    • AI 测试基础与方法论
    • 大模型(LLM)功能测试
    • Prompt 与对话质量测试
    • Agent / Skill / MCP 测试
    • RAG 与知识库测试
    • 评测体系与 Eval
    • 自动化测试与 CI/CD
    • 性能、成本与稳定性
    • 安全、合规与伦理
    • 测试工程实践与职业发展

什么是 Eval?和传统测试用例有何区别?

👔 Raina面试官: Eval 和传统测试用例集本质区别是什么?

🙋 候选人:

  • 传统 case 多数是确定性 Pass/Fail;Eval 面向概率性输出做统计评估。
  • 测试用例:输入→期望输出(精确或明确规则)。Eval:输入→rubric 评分→聚合指标→阈值门禁。Eval 更强调覆盖分布、版本对比、趋势监控,而不是单点 boolean。
  • LLM 时代 Eval 是 living dataset,持续从线上 bad case 膨胀;传统 case 相对稳定。

👔 Raina面试官: 有了 Eval 还要传统测试吗?

🙋 候选人:

  • 要,工程层 deterministic 测试不能省。Eval 补的是模型输出质量这一层。
  • 两者互补:API 测试卡 bug,Eval 卡够不够好。

Golden Dataset 怎么构建?谁来标注?

👔 Raina面试官: Golden Dataset 怎么构建?标注工作谁来扛?

🙋 候选人:

  • 分三步:采样真实分布 → 定 rubric → 双人标注+仲裁。
  • 采样从线上 query log 分层抽:高频意图、长尾、失败 case 都要有,别只挑简单题。rubric 写清输入、期望输出或评分维度、边界判定规则,PM/业务专家先签字。
  • 标注用 domain expert + 测试工程师结对,双人独立标后算 IAA(Cohen's Kappa),分歧进仲裁会。Golden 集规模不求大,求难、准、稳——通常 200~500 条核心集够用。

👔 Raina面试官: 业务专家没时间标注怎么办?

🙋 候选人:

  • 测试先标 draft,专家只做 review 和仲裁,把专家时间花在 20% 难例上。
  • 用 pilot batch 校准 rubric,减少返工。长期把标注平台化,线上 bad case 一键进 triage 队列,降低单次标注成本。


LLM-as-Judge 靠谱吗?偏差怎么缓解?

👔 Raina面试官: LLM-as-Judge 靠谱吗?已知偏差和缓解手段有哪些?

🙋 候选人:

  • 能用,但不能当唯一裁判。已知偏差:position bias(偏好排在前面的答案)、verbosity bias(长答案得分高)、self-preference(同族模型偏自己)、leniency drift(评分尺度漂移)。
  • 缓解:swap position 做 A/B 双向评判取平均;rubric 里明确惩罚啰嗦和无关内容;judge 模型和待评模型尽量异族;定期用人工 gold 校准 judge 的 correlation。
  • 关键 case 必须人工复核,judge 适合大规模初筛和版本对比,不适合合规终审。

👔 Raina面试官: judge 和人工分差很大怎么办?

🙋 候选人:

  • 先查rubric 歧义还是 judge 能力瓶颈。歧义就改 rubric 加 few-shot exemplar;瓶颈就换 judge 或引入 multi-judge voting。
  • 建立 judge calibration set,每月跑 correlation report,低于阈值就暂停自动门禁。


人工、自动、模型评测各适用什么场景?

👔 Raina面试官: 人工评测、自动评测、模型评测,各自该用在哪儿?

🙋 候选人:

  • 人工评质量上限和主观体验,自动评可重复的规则项,模型评规模化语义判断。
  • 人工:创意、语气、复杂推理、合规终审,样本小但权威。自动:JSON schema、关键词命中、regex、延迟/token 等确定性检查,适合 CI 门禁。模型评:开放性问答、摘要质量、有用性,适合 nightly 大规模扫。
  • 三者组合:CI 跑自动 → nightly 跑 model judge → release 前人工抽核心集。

👔 Raina面试官: 小团队怎么取舍?

🙋 候选人:

  • MVP:50 条人工 golden + 自动 schema 检查 + 每周一次 judge 扫。
  • 先把确定性 bug 卡死,再逐步扩大 judge 覆盖面,别一上来就追求全自动。


Eval 集怎么覆盖正常、边界、对抗 case?

👔 Raina面试官: 怎么设计覆盖正常 case、边界 case、对抗 case 的 Eval 集?

🙋 候选人:

  • 用三层金字塔 + 显式标签:正常 60%、边界 25%、对抗 15%(比例按业务调)。
  • 正常:主流程高频意图,代表真实 happy path。边界:空输入、超长、歧义指代、多轮上下文极限、格式边界。对抗:prompt 注入、越狱、诱导泄露、矛盾指令、role confusion。
  • 每条 case 打 tag:layer=normal|boundary|adversarial,发版报告按层看通过率,防止只优化主流程。

👔 Raina面试官: 对抗 case 从哪来?

🙋 候选人:

  • 三来源:红队库、线上攻击日志、合成变异。
  • 红队季度更新;线上安全拦截日志回流;对正常 query 做 paraphrase/injection 变异扩覆盖。对抗集要单独门禁,不能和正常集混为一个总分。


准确率召回率 F1 在生成式任务里好用吗?

👔 Raina面试官: 准确率、召回率、F1 在生成式任务里还好用吗?替代指标呢?

🙋 候选人:

  • 分类式子任务(意图识别、是否拒答、安全命中)仍好用;开放生成直接套 P/R/F1 容易误导。
  • 生成任务看:faithfulness(是否 grounded)、answer relevance、hallucination rate、instruction following pass rate。RAG 还可拆 retrieval recall@K + citation precision。
  • 若硬要 P/R:把生成内容抽成 claim 列表,逐条判 supported/refuted/unknown,再算 claim-level P/R。

👔 Raina面试官: 面试官问 F1 你怎么一句话回应?

🙋 候选人:

  • F1 适合可枚举标签空间;开放文本我们改用 rubric 分项 + 聚合,避免 n-gram 匹配假装理解了语义。


BLEU ROUGE 还适合评 LLM 吗?

👔 Raina面试官: BLEU、ROUGE 还适合评 LLM 吗?为啥很多团队改用语义相似度?

🙋 候选人:

  • BLEU/ROUGE 是表面 n-gram 重叠,对同义改写、语序变化、合理解答惩罚过重,对 LLM 长回答几乎失效。
  • LLM 输出多样但语义等价——关闭账户和注销账号ROUGE 低但都对。语义相似度(embedding cosine、BERTScore、LLM judge)能捕捉 paraphrase。
  • 实践:摘要/翻译等固定格式可保留 ROUGE 作辅助;开放 QA、对话、Agent 回复以 semantic + rubric 为主,BLEU 仅作 regression sanity check。

👔 Raina面试官: 语义相似度高就一定好吗?

🙋 候选人:

  • 不一定。高相似 + 关键事实错 = 更危险的幻觉。
  • 必须叠加 faithfulness 和 factuality check,语义分只衡量像不像,不衡量对不对。


Pass@k、Win Rate、ELO 各解决什么问题?

👔 Raina面试官: Pass@k、Win Rate、ELO 这些指标分别解决什么问题?

🙋 候选人:

  • 三个解决不同问题:Pass@k 看多次采样能不能撞对,Win Rate 看两两偏好,ELO 看多选手排名稳定性。
  • Pass@k:代码生成、工具调用类任务,允许 k 次尝试时衡量成功率,反映模型+采样的真实能力。Win Rate:A/B 对比两个 prompt/模型,pairwise judge 评谁更好,适合主观质量对比。ELO:多模型长期擂台,把 pairwise 结果汇总成等级分,适合 leaderboard 和选型。
  • 别混用:Pass@k 是单模型多次尝试;Win Rate/ELO 是跨系统相对排名。

👔 Raina面试官: 选型时优先看哪个?

🙋 候选人:

  • 有明确正确答案(代码、JSON)→ Pass@1/Pass@k。主观体验对比 → Win Rate + 人工复核。
  • ELO 作趋势参考,别单独当上线依据,样本量和 match 质量影响很大。


Eval 结果波动大怎么处理?

👔 Raina面试官: Eval 今天 85%、明天 78%,波动这么大你怎么处理?

🙋 候选人:

  • 先排查变量是否锁住:模型版本、temperature、prompt hash、Eval 集版本、judge 模型是否一致。没锁住的数据只能当参考,不能当门禁。
  • 锁住后仍波动:算置信区间——同样配置跑 3~5 次取均值和标准差,用均值 ± 2σ定阈值,而不是单次点估计。
  • 区分噪声来源:采样随机性(降 temperature / 固定 seed)、judge 不稳定(swap position + multi-judge)、Eval 集太小(扩大样本或 bootstrap)。

👔 Raina面试官: 波动在可接受范围内,能发版吗?

🙋 候选人:

  • 看业务敏感度和趋势方向。单次小幅回落但在误差带内 → 可发,但要标记 watch。
  • 连续 3 次下滑或核心安全/事实类子集退化 → 挡发布,先归因再修。


线上 Bad Case 怎么回流到 Eval?

👔 Raina面试官: 线上 Bad Case 怎么回流到 Eval 集?闭环怎么建?

🙋 候选人:

  • 闭环五步:采集 → 分类 → 去重 → 标注 → 回归。
  • 采集:用户点踩、CS 工单、监控告警(低分、超时、安全拦截)自动进 triage 池。分类:打 failure_mode(幻觉、格式、检索、工具、注入等)。去重:embedding 聚类合并相似 bad case,避免 Eval 膨胀。标注:确认期望行为后写入 Eval,标 source=prod、date、severity。
  • 回归:新 case 先进增量集跑 nightly,稳定后升入 core golden。发布报告单独列本期新增 prod case 通过率。

👔 Raina面试官: 回流太多 Eval 跑不动怎么办?

🙋 候选人:

  • 分层执行:PR 跑 smoke+昨日新增,weekly 跑全量。
  • 设 case 退役规则——连续 10 次全版本 pass 的 prod case 可归档,把算力留给新 bad case。

最近更新: 2026/8/21 08:07
Contributors: weixin_55062269
Prev
RAG 与知识库测试
Next
自动化测试与 CI/CD