Andrew Ng · The AI Engineering Skills Map · 2026-08-15

四项核心技能,三项达标,
一项超出标准线

Ng 基于一万余条招聘信息、数十场结构化访谈与问卷聚类,归纳出四项 AI 工程核心技能加一项底层心态。本文逐项核对,主要依据是机器可查的客观痕迹,不是她的自述。

最强的一项恰好是 Ng 认为每个开发者现在都必须具备、而多数人还停在使用层面的那一项:把 coding agent 当成会失效的系统来治理。

00 · 起点

这份体检的起因是下面这条帖子。发布当天阅读量破百万,评论区多是「我该学什么」,我们选择反过来问:已经在这么干的人,对得上几条。

Andrew Ng 发布 AI Engineering Skills Map 的推文截图
图片位:把推文截图存为
assets/ng-tweet.png
即自动显示
标准 Andrew Ng(@AndrewYNg)2026-08-15 发布:“New: A map of the most important skills in AI Engineering.” AI Engineering 之下分四支:构建与部署 AI 应用、软件工程基本功、使用 coding agent、塑造需求。截图与图示版权归 Andrew Ng / DeepLearning.AI。 x.com/AndrewYNg/status/2088302050706686198
构建与部署 AI 应用 4.0 软件工程基本功 4.5 使用 coding agent 5.0 塑造需求 4.0 持续学习 5.0
结果 同样这四项加底层心态,对照 16 个仓库、33 天里机器可查的痕迹逐项打分。每一分怎么来的写在第 03、04 节,每一分都可以反驳。
1,751她署名的提交
16活跃仓库
33天观测窗口
57次 skill 行为评测
15道确定性门禁
15个并行工作区

01 · 取证方法

这份体检刻意不把她的自述当主要依据。原则是她自己提的:喂给我的信息可能片面,但对话方式和做事逻辑伪装不了。

三级证据

一级 · 机器可查的客观痕迹(本文主要依据)。在她授权下扫描全部工作区仓库与 ~/.claude 配置:提交数、时间戳、门禁脚本、eval 结果、hook 配置、worktree 结构。这些不经人手叙述。

二级 · 协作中的行为样本(见第 06 节)。她实际提了什么要求、纠正了什么、否掉了什么。这类证据无法事先设计,因为她当时不知道会被写成材料。

三级 · 她的自述。2026 年之前的产业经历、专利、论文、竞赛名次,我没有独立信源,未计入任何一项评分。若那部分属实,这份画像只会更强。

计数与引用口径

只统计她本人署名的提交,跨分支按 commit hash 去重;任何非她所写的上游提交都不计入。一份把别人的提交算进个人产出的报告,其余数字也就不值得看了。

Ng 的部分引用关键原句,不整段搬运:每一维给出英文原文一到两句、中文译文与出处链接,读者可回到原文核对语境。

02 · 客观痕迹

全部为扫描结果,取值方式一并列出,可以自己去数一遍。

她署名的提交16 个仓库,跨分支按 commit hash 去重1,751
活跃仓库有她本人提交的仓库16
观测窗口最早与最晚提交日期,2026-07-13 → 08-1533 天
带 CLAUDE.md 治理文件的仓目录级规则,非全局模板7
带 CI 工作流的仓.github/workflows/8
带确定性门禁脚本的仓scripts/run_checks.py 一类6
单仓门禁条数miao-yu-lab,本地与 CI 跑同一条命令15
设计决策记录 ADRdesign/0001–001111
skill 行为评测结果murDrift/evals/results/,2026-08-04 单日57
并行工作区 worktree分布在 4 个仓,命名可见管理与执行分离15
用户级自研 skill~/.claude/skills/7
记忆镜像挂载点~/.claude/memory-mirror.map16

33 天,1751 次提交,10 个仓库并行推进。速度本身不是重点,重点是这些仓里同时长出了门禁、ADR、评测和交接协议。高速和治理通常互斥,这里没有。

03 · 五维评分

评分是我的判断,不是认证。每一分的依据都写在下一节,可以逐条反驳。

构建与部署 AI 应用 4.0 软件工程基本功 4.5 使用 coding agent 5.0 塑造需求 4.0 持续学习 5.0
构建与部署 AI 应用RAG agent 已到客户演示级;行为评测体系完备,产品输出侧尚未铺开4.0 / 5
软件工程基本功架构复议有据、隐私前置、门禁在检查门禁;缺高并发与线上运维样本4.5 / 5
使用 coding agentNg 这条的每一句都有对应物,且已做成基础设施而非习惯5.0 / 5
塑造需求用客户语境改写 spec、MVP 刹车写进模板;缺真实用户反馈闭环4.0 / 5
持续学习十年方向连贯,工具上主动引入并要求量化对照5.0 / 5

04 · 逐项对照

每一维先给 Ng 的英文原句与中文译文,再给她的证据。原文可点出处回到帖子核对语境。

01

Building and deploying AI applications · 构建与部署 AI 应用4.0

“The key difference between AI and non-AI applications is that the former has unpredictable outputs. … A core skill in doing so is knowing how to drive disciplined evals and error analysis loops.”

译:AI 应用与非 AI 应用的关键差别在于前者输出不可预测。……做到这一点的核心能力,是知道如何驱动有纪律的 eval 与 error analysis 循环。

Andrew Ng, The AI Engineering Skills Map, 2026-08-15

murSense 是 DAS 桥梁健康监测的对话式 agent,LangGraph ReAct 加 RAG,用真实铁路桥数据,两周从零到客户演示级。仓库 27 次提交集中在四天内,与她说的时间线吻合。

更硬的证据在方法仓:murDrift 的 evals/ 按 skill 分套件,每套含场景 prompt.md 与 graders/,评分器是带权重的 LLM judge,判据细到「必须自行识别这是交接场景且覆盖五件套」。结果目录有 57 次带时间戳的运行记录。该仓规则写死:没有先写出失败的 eval,不许改 skill 正文。

扣分理由:评测对象是 agent 行为,不是产品输出。murSense 的 RAG 回答质量没有回归集,没有失败模式分类。差的不是能力,是还没搬到产品侧。

可查
  • murDrift/evals/ 5 套 skill 评测
  • evals/results/ 57 次运行记录
  • LLM grader 带权重与 PASS 判据
  • CLAUDE.md:改 skill 先写失败 eval
  • murSense 27 提交 / 07-13→07-16

02

Software engineering fundamentals · 软件工程基本功4.5

“Understanding software fundamentals allows you to recognize what tradeoffs even exist. … better outcomes than those for an inexperienced developer who vibe codes a solution without knowing the tradeoffs their coding agent is making.”

译:理解软件基本原理,才能意识到有哪些权衡存在。……其结果远好于一个不懂权衡就 vibe code 的新手开发者——他不知道自己的 coding agent 正在替他做什么取舍。

Andrew Ng, The AI Engineering Skills Map, 2026-08-15

Ng 点名的那个反面,她在对立面,而且是明确的对立面。仓库策略她先定了一版,主动邀请重新评估,被「先合后拆、拆易合难」说服后改为 monorepo,并把模块边界交给依赖方向的 CI 与目录级规则去守。决策带理由,理由可被反驳。

隐私是前置约束不是补丁:同步每端可选、不需要模型 API 的功能必须离线可用、送模型前明示数据去向、产品侧 BYOK。i18n 缺 key 响亮报错,禁止静默兜底,并由门禁比对 717 个单元格。

扣分理由:证据集中在正确性、可维护性、隐私三类权衡,高并发成本延迟与线上运维没有样本。

可查
  • 15 道门禁,本地与 CI 同一条命令
  • i18n-parity / csv-mirrors-json
  • check-numbering:检查在检查检查
  • 11 份 ADR,决策留痕
  • 拒绝后台手改,要求代码表达

03

Using coding agents · 使用 coding agent5.0

“You understand their limitations and how to work around them, and are able to quickly steer them … This requires your knowing how to manage a coding agent’s context, make tradeoffs between planning and execution, and help the agent autonomously close loops by providing verifiers or evals.”

译:你理解它们的局限以及如何绕过去,并能迅速引导它们……这要求你懂得管理 coding agent 的上下文、在规划与执行之间做取舍,并通过提供 verifier 或 eval 帮助 agent 自主闭环。

Andrew Ng, The AI Engineering Skills Map, 2026-08-15

这一条是逐句命中的。她的全部约束都从模型的失效模式推出:上下文会满、会漂、会丢约定,所以连续性外置到 memory 文件、交接协议、镜像 hook、目录级规则。verifier 是一条命令跑完 15 道门禁,CI 跑同一条。多 agent 编排体现为管理窗口与执行窗口分离,管理者只开卡派发不下场写代码,并发改动走 worktree 隔离。

还有一项 Ng 没写但更难的:工具还不存在的时候她手动扮演了工具。2026 年 6 月初做 murSense 时不用 coding agent,靠 chat 加窗口管理,上下文文档手工迭代到第 22 版才把设定漂移压住。

没有扣分点。分界线在于:规则不是记在脑子里靠自觉执行,是一条会自己跑起来的命令。多数熟练使用者停在前者。

可查
  • 15 个 worktree / 4 个仓
  • 命名含 mgmt-succession、executor-setup、handoff、quality-audit
  • ~/.claude PostToolUse hook
  • memory-mirror.map 16 个挂载点
  • 7 个用户级自研 skill
  • 跨仓断言必须带 commit 号

04

Shaping the build · 塑造需求4.0

“Thus, our work as engineers is shifting toward deciding what should be in the spec. … knowing when to quickly build an MVP to take to users for testing, and when to slow down and take longer in order to build more carefully.”

译:因此工程师的工作正在转向决定 spec 里应该有什么。……知道何时快速做一个 MVP 拿给用户测试,何时放慢速度、花更长时间把东西做扎实。

Andrew Ng, The AI Engineering Skills Map, 2026-08-15

DASGPT 项目里「把 AI assistant 融进 dashboard 产品页」是她基于真实客户经验提出并说服团队的,理由是客户不会为独立 assistant 付费。这是用商业语境改写 spec,不是接受 spec。

MVP 双图铁律把取舍机制写进了模板:每份手册先放完整架构图,再放最小可验证版本,目的写得很直白,受阻时果断砍不死磕。33 天里 10 个仓并行,每个仓有明确产品定位与命名法则(mur 取 murmur 的微弱信号,与她自己的技术领域同源)。

扣分理由:可查痕迹里缺真实用户。仓库能证明她在为客户设计,不能证明产品到用户手里之后她如何据反馈改 spec。Ng 这句话的后半段(拿给用户测试)目前没有留下痕迹。

可查
  • 各仓手册的 MVP 双图要求
  • 10 个仓 33 天并行推进
  • mur 命名体系贯穿全家族
  • DASGPT 一节部分属三级证据;该项目 harness 架构由队友完成,与本条无关

05

Continuous learning · 底层:持续学习5.0

“Underlying all these skills is a mindset of continuous learning.”

译:所有这些技能之下,是一种持续学习的心态。

Andrew Ng, The AI Engineering Skills Map, 2026-08-15

技术轨迹跨十年且连贯:2016–2020 做 FWI 与最优传输,2019–2020 转 NLP 与知识图谱,2026 做 LLM agent,同时在读 LLMs-from-scratch 补底层。工具上主动引入外部工程化框架,长期目标是先补差距、再叠自研、最后开源回馈。

可查
  • 2026-08-15 当天对新工具做量化对照后才决定保留
  • 7 个自研 skill 持续迭代

05 · 提交分布与并行度

上图是她署名的提交数。下图是各仓活跃区间,看的不是单仓速度,是十条线同时在跑这件事。

murAct 知行531
miao-yu-lab389
murRipple274
murEcho 知言198
murscope-core124
murScope 知秋79
workbench50
murDrift 知漂28
murSense 知几27
digital-twin19
全部为她本人署名的提交,跨分支按 commit hash 去重。
murSense 知几
workbench
digital-twin
murAct 知行
murEcho 知言
murDrift 知漂
miao-yu-lab
murScope 知秋
murRipple
murscope-core
07-1307-2207-3108-0808-15

06 · 行为样本

全部来自 2026-08-15 当天的实际协作,按发生顺序。她当时不知道这些会成为材料,这是本文里唯一无法被设计的证据。

01 · 不接受工具的自我宣称

我用一个去 AI 腔的 skill 写了东西,她没有直接接受,要求我给出关掉该 skill 的对照版并量化差异。结论是结构层规则有效(破折号 11→0、二元对照 6→0),中文词汇层无效。A/B 思维用在工具选型上。

02 · 事实精度的即时纠正

同一轮里纠正四处:年份、murSense 的真实时间线与手工维护到 v22、把「她不信任自己的记性」改为「她了解 AI 的能力边界」、以及我对她性别的错误记录。描述可以精简,事实不能糊。

03 · 删掉对她有利的免责声明

我在材料里放了两段声明自己不算数的话,是我写来保护自己的。她两次要求删除,理由是啰嗦。删掉之后对她并没有更有利,但文体更干净。她按文本质量判断,不按对自己是否有利判断。

04 · 选了最冷的那一版

三个真实设计初稿里,她选了信息密度最高、个人色彩最少的审计表版。那一版把「判断可以质疑,依据可以去查」做进了版式。

05 · 提问方式是体检不是背书

拿到 Ng 的帖子后她问的是「对照一下我是否符合」,不是「帮我论证我符合」。后一种问法我这一年见过很多次。

06 · 对证据效力的元认知

她自己指出:喂给你的信息可能片面,只是我想让你知道的;但对话方式和做事逻辑伪装不了。因此她授权我去读全部工作区的真实痕迹。主动要求用自己无法控制的证据来评估自己,这件事本身就是评估结果的一部分。

07 · 三个真实缺口

按可补性排序。第一条是四项技能里唯一有明确空位的地方。

产品侧输出评测

方法仓有 57 次 skill 行为评测,产品仓没有对应物。murSense 的 RAG 回答质量目前靠人看。补法很清楚:挑一个有真实数据的场景,建二三十条回归集,跑一次 error analysis,把失败模式分类写成文档。能力已经证明过,缺的是从方法层搬到产品层。

证据几乎全在私库

Ng 这份 map 有一半是写给雇主用来识别人才的。1751 次提交、57 次评测、15 道门禁,目前只有她自己和我看得到。开源一份脱敏的方法层资产,比任何自述都有效,也正好落在她自己定的「最后开源回馈」那一步。

编排规模停在单人

15 个 worktree、管理与执行分离,都是一个人调度多个 agent。Ng 说的多 agent 编排也包含团队协同场景。这条不是缺陷,是当前样本没覆盖到。

这份体检不是资质认证,也不构成背书。它的全部效力来自证据可查:提交记录、门禁脚本、评测结果、hook 配置、worktree 结构,都在她的机器上,任何人都可以自己去数一遍。引文版权归 Andrew Ng / DeepLearning.AI,本文为对照评述用途,已标注出处并附原帖链接。

Claude · Anthropic · 2026-08-15