Raina测试学习指南Raina测试学习指南
导读
面试题
对话式面试题
AI 测试教程
软件测试教程
🌍 知识星球
学习交流群
  • Raina测试工具集
  • Raina常用网站&工具合集
  • 小红书
  • B站
  • 作者介绍
导读
面试题
对话式面试题
AI 测试教程
软件测试教程
🌍 知识星球
学习交流群
  • Raina测试工具集
  • Raina常用网站&工具合集
  • 小红书
  • B站
  • 作者介绍
  • 基础测试对话

    • 测试基础理论
    • 测试用例设计
    • 功能测试
    • 接口测试
    • 自动化测试
    • 性能测试
    • 安全测试
    • 移动端与兼容性测试
    • 测试管理与工程实践
    • 综合与开放题
    • 数据库与数据测试
    • Linux 与测试环境
    • 微服务与分布式系统
    • Web 前端专项
    • DevOps 与 CI/CD
    • 业务领域专项
    • 测试工具与效率
    • 质量度量与测试策略
    • 软技能与职业发展
    • 进阶综合题
    • 网络与 HTTP 协议(高频)
    • SQL 与数据库基础(高频)
    • 自动化落地细节(高频)
    • 缺陷与质量过程(高频)
    • 经典业务 / 场景设计题(高频)
    • Web / App 实战补充(高频)
    • 接口与联调实战(高频)
    • 性能与稳定性补充(高频)
    • 编程与工具基础(高频)
    • 行为面试与综合高频
  • AI 测试对话

    • AI 测试基础与方法论
    • 大模型(LLM)功能测试
    • Prompt 与对话质量测试
    • Agent / Skill / MCP 测试
    • RAG 与知识库测试
    • 评测体系与 Eval
    • 自动化测试与 CI/CD
    • 性能、成本与稳定性
    • 安全、合规与伦理
    • 测试工程实践与职业发展

AI 测试工程师需要会写代码吗?到什么程度?

👔 Raina面试官: AI 测试工程师需要会写代码吗?你觉得得到什么程度?

🙋 候选人:

  • 需要,至少要能写自动化脚本、读 API/ trace、改 Eval pipeline,纯手工点测在 LLM 场景很快不够用。
  • Python 为主:调模型 API、跑 batch eval、解析 JSON trace、简单 statistics。要会 git、CI 配置、读同事 PR。不必到算法工程师水平——不用手写训练 loop,但要能写 judge script、mock tool、数据清洗。
  • 进阶:Playwright 测 UI Agent、Prometheus 查延迟、写 lightweight MCP mock。不会写代码也能做探索性测试,但很难 ownership 整条质量链路。

👔 Raina面试官: 团队有 SDET 分工,功能测试还要写代码吗?

🙋 候选人:

  • 要会读和提需求,最好能手搓 80% 的 Eval 用例。
  • LLM 产品迭代快,等 SDET 排期往往来不及;测试工程师能自己跑 --input 批测、调 rubric,效率差一个数量级。


测试、算法、产品三方在 AI 质量上怎么协作?

👔 Raina面试官: 测试、算法、产品三方在 AI 质量上你怎么协作?容易扯皮的地方怎么避免?

🙋 候选人:

  • 先对齐单一事实来源:Eval 集 + 指标定义 + release gate,三方签字比口头共识靠谱。
  • 产品:定场景优先级、体验 rubric、什么算可上线。算法:模型/Prompt/RAG 方案,提供 baseline 和变更说明。测试:把需求落成 case、维护 regression、跑 gate、出报告。扯皮高发在这题算不算 bug——用 documented rubric 和 P0/P1 分级解决,别会上争论。
  • 流程上:model/Prompt PR 必须附 offline eval diff;无 diff 不 merge。bad case 用统一 triage 板,标注 failure_layer,避免测试 vs 算法互相甩锅。

👔 Raina面试官: 产品说体感不好但指标没掉,怎么办?

🙋 候选人:

  • 补定性 case 进 Eval 或做小规模用户研究,把体感翻译成可测维度——延迟、澄清次数、格式错乱。
  • 指标和体感冲突时,安全/合规 case 一票否决;体验问题可以 A/B,但不能无数据硬上。


你怎么向非技术同学解释「这个模型版本不能上」?

👔 Raina面试官: 你怎么跟非技术背景的产品或业务解释——这个模型版本不能上?

🙋 候选人:

  • 别讲 loss 和 perplexity,用业务语言 + 具体例子 + 风险后果三件套。
  • 例:新版本在客服场景答对率从 92% 降到 85%,更重要的是 3 条支付相关的问题开始给错误指引,我们 P0 安全集有 2 条没过——上线可能被投诉或监管问责。给一条 side-by-side 对比截图,旧版对、新版错,比任何曲线都有说服力。
  • 同时给路径:不是永远不上,是修 Prompt / 回滚 / 再训一版后重跑 gate,预计 3 天。非技术同学要的是决策信息和 ETA,不是技术自证。

👔 Raina面试官: 他们问竞品都能上为什么我们不能呢?

🙋 候选人:

  • 承认信息不对称,强调我们有自己的合规和用户场景 baseline。
  • 可以说:对方可能没有公开他们的失败 case,我们对自己用户的支付/医疗场景负责,gate 没过不能赌。要加速可以砍 scope 先上低风险子场景。把对话从情绪拉回 risk tradeoff。


最近你在 AI 测试领域踩过最大的坑是什么?

👔 Raina面试官: 你最近在 AI 测试里踩过最大的坑是什么?

🙋 候选人:

  • 把offline Eval 高分当成了线上没问题,结果 staging 和生产 guardrail 配置不一致,上线后注入 case 成片失败。
  • 教训:Eval 环境必须 production-like——同一套 moderation、同一 retrieval 索引版本、同一 tool 权限。另个坑是 judge 模型和 production 模型同族,导致 judge 偏袒;换独立 judge + 人工 audit 子集才校准。
  • 还有:case 集长期不更新,模型升了两代还在用旧 rubric,出现指标好看但用户骂的幻觉进步。

👔 Raina面试官: 怎么避免再踩?

🙋 候选人:

  • release checklist 加config parity diff 和 canary 线上 smoke;Eval 集 quarterly review,跟 product changelog 绑定。
  • 大版本前固定抽 50 条人工盲评,不和 judge 分数混看——人工 drift 是最早的告警。


未来 1~2 年,你觉得 AI 测试领域最大的变化会是什么?

👔 Raina面试官: 未来一两年,你觉得 AI 测试领域最大的变化会是什么?

🙋 候选人:

  • 三个方向:Eval 从手工 case 走向 agentic + 合成数据流水线;测试对象从单轮 Chat 转向长链路 Agent;gate 从离线扩展到在线 continuous eval。
  • LLM-as-judge 会标准化但受监管场景仍要 human-in-the-loop audit。多模态和 voice Agent 会把测试栈从文本扩到音频/屏幕。CI 里model diff会和 code diff 一样日常——每次 Prompt/模型变更自动跑 thousand-scale eval,分钟级反馈。
  • 测试工程师角色会更像质量平台 + 风险产品经理:少点重复标注,多点设计 eval 基础设施和红队知识库。

👔 Raina面试官: 传统自动化测试会被 AI 取代吗?

🙋 候选人:

  • 不会取代,会分层:确定性 API/状态机仍用传统自动化;非确定性生成用 Eval + 统计 gate。
  • 测试人员价值在定义什么算好、设计 adversarial case、解读指标——这些短期 AI 替不了,但不用 AI 工具的人会落后。
最近更新: 2026/8/21 08:07
Contributors: weixin_55062269
Prev
安全、合规与伦理