上个月组里来了个实习生,第一天就问我:勇哥,现在 AI 都能写脚本了,我们运维以后是不是没啥可干的了?

我没直接回答,让他先把我们线上那台机器的 /var/log/messages 从上周三到周五的报错拉出来看一遍。他看了半小时,回来跟我说:哥,里面全是 dhcp 续租失败的警告,还有几次 systemd 服务重启的记录。

我说好,那你用 AI 写个脚本,把这些报错按时间线整理出来,标出哪些是重复的、哪些是偶发的。

他五分钟就写完了,跑得还挺利索。然后我问他:那你说说,为什么上周四凌晨两点,这台机器重启了三次?

他愣住了。AI 能告诉他"有三次重启",但不会告诉他——那天凌晨有人在机房动过电源,UPS 切换的时候电压抖了一下,机器电源的余量又不够,才导致反复重启。这些事不在日志里,在值班记录里,在人的记忆里。

我不是说 AI 没用。恰恰相反,我天天用。写个解析脚本、查个语法、把一堆命令拼成一段逻辑,AI 比我自己敲快多了。以前写个 Python 脚本要半小时,现在五分钟搞定,效率翻倍。这玩意儿就是给运维提效的,不是来抢饭碗的。

但运维这行,值钱的从来不是"会敲命令"。值钱的是那些 AI 不知道的事:

机器为什么会在凌晨三点重启——因为它前面站着个半夜手滑的工程师。
客户为什么坚持说是我们网络的问题——因为他上个月刚被我们说过是他们代码的问题,这回得找回场子。
老板为什么突然问"最近系统稳不稳定"——因为他下午要跟大客户汇报,想拿点数据充门面。

这些事,AI 一个都不知道。它只知道 /var/log 里有什么,不知道日志背后站着什么人。

还有一件事,AI 永远替代不了:背锅的时候得有人站出来说"这个我来处理",救火的时候得有人真的爬起来去机房。AI 不会在凌晨两点四十接到电话,也不会在机房里蹲着等 RAID 重建完。它连机房长什么样都不知道,它只见过数据中心的图片。

所以那天实习生问我的时候,我说了句大实话:AI 能帮你把活干得越来越快,但"知道该干什么活"这件事,还是得靠人。脚本写得再溜,不知道系统为什么崩,照样白搭。

他似懂非懂地点了点头。希望他干个一年半载之后,能明白我说的这些。