评测通货膨胀
概述
AI 工具普及导致传统技术评测失去区分度的现象——通过评测不再意味着候选人具备传统评测试图验证的真实能力。
关键内容
- 现象定义:
- 传统技术评测(如 Leetcode 题目)假设候选人独立解题
- AI 工具可在几秒内解决大多数经典算法题
- AI 可通过多数代码完成性测试
- AI 可生成看起来合理的系统设计方案
-
结果:通过评测 ≠ 具备目标能力
-
根本原因:
- GitHub Copilot、Claude Code 等 AI 编程助手普及
- AI 代码生成能力快速提升,超越传统评测难度
-
评测题目更新速度跟不上 AI 能力提升速度
-
影响范围:
- 技术招聘:传统算法面试失去筛选价值
- 代码完成性测试:无法区分独立编码与 AI 辅助
-
系统设计面试:AI 可生成合理方案框架
-
应对方向:
- 转向抗 AI 评测设计:强调解释、诊断、动态深入
- 评测重点从"完成任务"转向"判断力和 AI 协作能力"
-
接受 AI 工具作为评测一部分,但评测工作质量
-
深层含义:
- 推动重新定义"什么是真正的技术能力"
- 从测试知识记忆和机械执行,转向测试理解深度和判断能力
- 不仅是招聘问题,更是技术教育领域需回应的挑战
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/19_ai_resistant_evals.md — 设计抗 AI 的技术评估(Anthropic Engineering Blog, 2026-01-21)
相关
- 抗 AI 评测设计 — relates_to(应对评测通货膨胀的方法论)
- 评测驱动开发 — relates_to(评测演进的背景)
- GitHub Copilot — relates_to(导致评测通货膨胀的工具之一)
- Claude Code — relates_to(导致评测通货膨胀的工具之一)