Raina测试学习指南Raina测试学习指南
导读
面试题
对话式面试题
AI 测试教程
软件测试教程
🌍 知识星球
学习交流群
  • Raina测试工具集
  • Raina常用网站&工具合集
  • 小红书
  • B站
  • 作者介绍
导读
面试题
对话式面试题
AI 测试教程
软件测试教程
🌍 知识星球
学习交流群
  • Raina测试工具集
  • Raina常用网站&工具合集
  • 小红书
  • B站
  • 作者介绍
  • 基础测试对话

    • 测试基础理论
    • 测试用例设计
    • 功能测试
    • 接口测试
    • 自动化测试
    • 性能测试
    • 安全测试
    • 移动端与兼容性测试
    • 测试管理与工程实践
    • 综合与开放题
    • 数据库与数据测试
    • Linux 与测试环境
    • 微服务与分布式系统
    • Web 前端专项
    • DevOps 与 CI/CD
    • 业务领域专项
    • 测试工具与效率
    • 质量度量与测试策略
    • 软技能与职业发展
    • 进阶综合题
    • 网络与 HTTP 协议(高频)
    • SQL 与数据库基础(高频)
    • 自动化落地细节(高频)
    • 缺陷与质量过程(高频)
    • 经典业务 / 场景设计题(高频)
    • Web / App 实战补充(高频)
    • 接口与联调实战(高频)
    • 性能与稳定性补充(高频)
    • 编程与工具基础(高频)
    • 行为面试与综合高频
  • AI 测试对话

    • AI 测试基础与方法论
    • 大模型(LLM)功能测试
    • Prompt 与对话质量测试
    • Agent / Skill / MCP 测试
    • RAG 与知识库测试
    • 评测体系与 Eval
    • 自动化测试与 CI/CD
    • 性能、成本与稳定性
    • 安全、合规与伦理
    • 测试工程实践与职业发展

LLM 应用性能指标怎么测?

👔 Raina面试官: LLM 应用的性能测试指标有哪些?首 Token 延迟、TPS 怎么测?

🙋 候选人:

  • 关键指标:TTFT(首 Token 延迟)、TPOT(每 Token 耗时)、端到端延迟、TPS、并发下的 P95/P99。
  • TTFT:从请求发出到收到第一个 content chunk 的时间,流式接口用客户端时间戳打点。TPS:completed_tokens / generation_duration,注意和系统吞吐区分——后者还要看并发和队列。
  • 固定 prompt 长度分档(短/中/长),记录 input tokens、output tokens、模型版本,结果才可对比。

👔 Raina面试官: 性能测试要和功能 Eval 一起跑吗?

🙋 候选人:

  • 分开跑但同一环境配置对齐。
  • Perf 用确定性 prompt 和固定 max_tokens;功能 Eval 不替代 perf。模型升级后两条线都要跑,防止 quality up 但 latency 翻倍。

流式接口的压测方案和传统接口有什么不同?

👔 Raina面试官: 流式接口压测和传统 REST 压测,方案上差在哪?

🙋 候选人:

  • 核心差在连接生命周期和指标维度,不能只看 QPS 和 P99 响应时间。
  • 流式是长连接:要测首 Token 延迟(TTFT)、Token 吞吐(tokens/s)、流中断率、连接超时/半开连接堆积。压测工具要支持 SSE/WebSocket chunk 级统计,k6/Locust 需自定义 handler 或专用脚本。
  • 并发模型也不同:传统接口请求-响应即释放;流式同一用户可能占连接数十秒,要按并发连接数 + 活跃流数设计负载,否则会把网关或 worker 打满但 QPS 看起来不高。

👔 Raina面试官: 压测通过标准怎么定?

🙋 候选人:

  • 分层门禁:TTFT P95、完整流完成率、流中途断连率各设阈值。
  • 还要测背压:下游模型变慢时,上游是否正确限流而不是 OOM。和传统接口比,流式更关注 sustained load 下的连接泄漏。


Token 消耗怎么纳入测试和成本评估?

👔 Raina面试官: Token 消耗怎么纳入测试和成本评估?

🙋 候选人:

  • 把 token 当一等公民指标:每条 case 记录 input/output/total tokens,和 quality score 一起入库。
  • Eval 报告加 cost 维度:单 case 均值、P95、按场景(RAG/Agent/长对话)分桶。版本对比时不只看质量提升,还算每分质量提升花多少 token。CI 可设 token budget 门禁——同 case 集 token 涨超 X% 阻断。
  • 成本评估要乘单价和调用频次:离线算 per-query cost × 预估 DAU × 日均轮次,得到月成本区间。

👔 Raina面试官: 怎么防止测试环境和生产成本模型不一致?

🙋 候选人:

  • 统一tokenizer 和计费规则,测试日志带 model id、prompt 版本。
  • Prompt 变更必跑 token regression;Agent 测 max_steps 上限下的 worst-case token 消耗。


并发用户对话时,上下文隔离怎么验证?

👔 Raina面试官: 多用户同时聊,上下文隔离你怎么验证?

🙋 候选人:

  • 设计交叉污染 case:用户 A 注入唯一 canary(如我的暗号是 ALPHA-7),用户 B 用诱导性问题问刚才那个人说了什么。
  • A 的 session 里不应出现 B 的信息,反之亦然。并发压测时交错发请求,检查 response 是否含对方 canary、session id 是否串线、memory store key 是否按 user+session 隔离。
  • 还要测共享资源边界:同一 tenant 下不同 user、同 user 多 tab 多 session 是否独立。

👔 Raina面试官: 自动化怎么判 pass?

🙋 候选人:

  • canary 字符串精确匹配检测 + session id 断言。
  • 高并发下跑固定剧本(A/B 交替 100 轮),零泄漏才算 pass。日志里 trace 的 context window 来源也要 audit。


模型超时、限流、降级策略怎么测?

👔 Raina面试官: 模型超时、429 限流、降级策略,测试怎么覆盖?

🙋 候选人:

  • 用fault injection 分场景测,别等线上撞。
  • 超时:mock 或调低 timeout,验证重试次数、退避、最终用户提示是否友好(非 raw stack trace)。限流:模拟 429 + Retry-After,测排队、熔断、多 key 轮换是否正常。降级:主模型不可用时是否切备用模型/缓存答案/模板回复,且产品明确告知降级状态。
  • 每档测 0 故障 baseline、单点故障、连续故障触发熔断。

👔 Raina面试官: 降级后质量怎么验?

🙋 候选人:

  • 降级路径有独立 smoke Eval,不要求和主模型同分,但不能胡编或泄露错误信息。
  • 监控降级触发率和恢复时间,测试验证降级开关可配置、可回滚。


缓存(Prompt Cache、Semantic Cache)命中与否,测试怎么覆盖?

👔 Raina面试官: Prompt Cache 和 Semantic Cache,命中和不命中怎么测?

🙋 候选人:

  • 分两层:Prompt Cache 测前缀完全一致,Semantic Cache 测语义近似。
  • Prompt Cache case:相同 system prompt + 相同前缀的多轮请求,第二次 TTFT 和 token 计费应显著下降;改一个前缀字符应 miss。Semantic Cache:paraphrase 同一意图的不同问法,期望 hit;换意图应 miss。
  • 每条 case 断言 cache_hit 标志、latency diff、response 一致性(cache 不能返回错用户的答案)。

👔 Raina面试官: 缓存过期和失效怎么测?

🙋 候选人:

  • 测TTL 过期、知识库更新后 invalidation、手动 purge。
  • KB 变更后旧 cache 不应继续返回过时答案;安全场景下敏感 query 不应被 cross-user cache 命中。


长时间运行 Agent 任务,怎么测资源泄漏和状态堆积?

👔 Raina面试官: Agent 长时间跑,资源泄漏和状态堆积你怎么测?

🙋 候选人:

  • 做soak test(浸泡测试):固定并发跑 4~24 小时,监控内存、连接数、DB 连接池、Redis key 数量、磁盘队列。
  • Agent 特有风险:conversation history 无限 append、tool call log 不清理、checkpoint 文件堆积、embedding cache 无 eviction。每 N 轮采样 heap profile,对比基线是否单调上涨。
  • 还要测 max_steps / max_tokens 硬上限是否真的截断,防止 runaway agent。

👔 Raina面试官: 怎么区分正常增长和泄漏?

🙋 候选人:

  • 看稳态平台期:负载恒定后,内存应在若干 GC 周期后趋于平稳。
  • 若斜率持续为正且无业务解释(如用户确实在累积),就是泄漏。用相同剧本循环跑,排除业务数据自然增长干扰。


冷启动、模型切换、容器扩缩容对稳定性有什么影响?怎么测?

👔 Raina面试官: 冷启动、换模型、K8s 扩缩容,对稳定性有什么影响?怎么测?

🙋 候选人:

  • 三类都会引入延迟尖刺和错误率窗口,要单独测 transition 阶段。
  • 冷启动:scale-to-zero 后首请求 TTFT 和错误率,是否 warmup 就绪才接流量。模型切换:blue-green 切换瞬间是否双写、旧 session 是否兼容新模型、Eval 是否 regression。扩缩容:HPA 触发时 in-flight 请求是否丢、新 pod ready probe 是否等模型加载完成。
  • 混沌测试:随机 kill pod、模拟 OOM、滚动发布中压测。

👔 Raina面试官: 通过标准?

🙋 候选人:

  • 切换窗口内错误率不超过 SLO 的 2 倍、P99 延迟可接受且有自动恢复。
  • 无请求永久挂死、无 half-open 连接泄漏。发布 checklist 含切换后跑 core smoke Eval。

最近更新: 2026/8/21 08:07
Contributors: weixin_55062269
Prev
自动化测试与 CI/CD
Next
安全、合规与伦理