execute_code 系列合集:从「AI只写不执行」到「一句话搞定」

这是埋在我本地的一整套系列文章——6篇完整稿,讲透了 execute_code 从认知到实操到心态的全过程。今天全部整理发布。

我被「AI只写不执行」骗了三年
15秒改完17个文件,我没复制一行代码。第一次真正被AI替执行震撼的经历。
三个让我拍桌子的 execute_code 场景
批量重构、一键测试、多步调研——每个都有真实代码,可直接改改用。
一个月省900万token?这笔账是这么算的
execute_code 到底省不省钱?我用实际账单算了一笔账。
踩坑集:我犯的三个蠢错误
execute_code 不全是爽。这把双刃剑我替你们试过了。
一张表说清楚该不该用
什么时候该用 execute_code?什么时候闭嘴用传统模式?决策清单在此。
三个月后,我终于明白「AI替你执行」意味着什么
从「值不值得让AI做」到「这活儿要不要做」——决策模型彻底变了。

—— 以下为第一篇全文 ——


第①篇:我被「AI只写不执行」骗了三年

我说:「把项目中所有旧API调用改成新的。」

它15秒就干完了,汇报了17个文件的改动清单。

而我,坐在那喝了一口水,什么事都没做。

你有没有觉得AI编程工具有哪里不对劲?

Copilot在我打字的时候给出灰色建议——我按Tab接受,然后自己贴到终端去跑。Cursor写了一整段逻辑——我复制到编辑器,手动运行看看对不对。Claude Code能执行命令——但每搜一个文件、每改一个地方,它都回来问我「这样可以吗?」

所有工具都假设同一个前提:AI负责写,人负责执行。

这两三年,我试过几乎所有主流AI编程工具。每次的体验都差不多:AI确实能写出不错的代码片段,但写完之后的工作流永远是——复制、粘贴、运行、看结果、复制错误、贴回去、让它改。循环往复。

本质上,我像一个传话筒,在AI和终端之间来回传话。

第一次用Hermes Agent时,我对它说:「把项目里所有requests.get改成httpx。」

它没有像往常一样在对话框里给我显示一段代码,然后等我去操作。它只说了一句「稍等」,然后大概15秒后回来:

「改好了,17个文件全部完成,跑了测试全部通过。」

我当时的第一反应是——等一下,它什么时候跑的?什么时候测试的?这中间发生了什么?

后来我才知道,在这15秒里,它自己完成了:搜索所有匹配文件→读取每个文件确认上下文→逐个执行替换→运行测试套件→汇总结果。没有一个中间步骤进到我的对话里来。

我下意识想复制代码去执行——才发现根本没有代码需要我复制。

这件事让我开始重新思考:AI编程工具到底应该怎么用?

对比一下传统AI和Hermes处理同一个需求的不同方式。传统AI的典型流程要6轮对话,每轮几KB的中间结果全部留在对话里,后续每多问一句,模型都要重新阅读这些中间信息。而Hermes Agent只用1次对话——中间执行过程完全在单独的子进程里完成。

我算过一笔账。同样一个三到四步的操作:传统AI一步步做消耗约21,000 token,execute_code一次完成消耗约500 token。节省了95%的上下文。

一开始我以为省钱是最大的好处。后来发现不是——更大的变化是心态上的。因为不担心中间结果撑爆对话,我开始更频繁地让AI去做一些以前觉得「不值当让AI做」的事情。

核心变化不是AI变强了,是我敢让它做的事变多了。

三个月前,我每天在终端和AI之间来回切换,感觉自己像个传话筒。

现在,我只需要说一句话,整件事就办完了。

—— 一切皆如

系列其他5篇继续阅读:

第②篇《三个让我拍桌子的execute_code场景》—— 批量重构、一键测试、多步调研的真实代码案例

第③篇《一个月省900万token?没吹牛》—— execute_code成本分析全曝光

第④篇《踩坑集:我犯的三个蠢错误》—— 替你们试过的双刃剑

第⑤篇《一张表说清楚该不该用》—— 什么时候用execute_code,决策清单

第⑥篇《三个月后我终于明白了》—— 从「值不值得让AI做」到「这活儿要不要做」