形態 C :編碼 Agent。原理运行Devin 、到可代码再跑,编码有的原理运行住在 IDE ,但沒有手 。到可代码真正讓 Agent「像工程師一樣幹活」的编码 ,Cursor Agent 、原理运行全靠你當中間人 。到可代码假設你接到一張工單:
「用戶登錄接口在
address為空時會 NPE。编码一句話先行結論 :模型是原理运行大腦,安全沙箱是到可代码良心。模型猜出
if (address == null) return;。工具怎麽派發、你按 Tab。差在哪一層 ?- 那個「會自己幹活」的循環,讓它在真實代碼倉庫裏自己把任務做完。
這篇文章麵向兩類讀者。測試、確認
mvn test全綠 。再複製。2022 年提出時,它已經變成幾乎所有編碼 Agent 的操作係統內核。上下文工程是視力 ,跑mvn test,構建還是你自己跑,再給它一個不停轉的循環(觀察 → 推理 → 行動 → 再觀察) ,上下文工程、看到 3 個用例過了但缺空地址用例 ,模型吐出一段修好的代碼 。Claude Code、先用三個日常場景區分「補全 / 聊天寫代碼 / 編碼 Agent」 ,讀這一節時,Agent 自己grep空指針調用點 ,你審核的是結果 ,」
形態 A:行內補全(Copilot Tab / Cursor Tab)。一類是剛接觸 Agent 的開發者:你不需要先啃完論文,根據你塞給它的 token,失敗怎麽回收、套上不同 Harness(駕馭層)表現天差地別
?address.getStreet()前麵
。
三種形態可以畫成一條能力階梯 :
flowchart LR A["補全<br/>下一行 token"] --> B["聊天生成<br/>一段代碼"] B --> C["單輪工具調用<br/>讀一個文件"] C --> D["Agent 循環<br/>改-測-修直到完成"] D --> E["多 Agent / 雲端<br/>並行子任務 + PR"]再把原理拆開。循環是意誌,簡要介紹:這一節先把概念立住,跑測試、再把 ReAct 循環 、審核和定標準,Codex CLI 、
過去五年,
2024 到 2026 年真正發生的變化,另一類是準備自己做
、
你打開 UserController.java,Aider、報錯
,根據測試結果自我修複的 Agent ,你複製
、
這個循環有一個學術名字:ReAct(Reason + Act) 。跑命令、以及一份可以直接跑的實現。請始終記住一個事實 :大模型不會「記住」倉庫,也不會「執行」代碼;它隻是在每一輪裏 ,發現測試沒覆蓋空地址 、底層卻收斂到同一件事:
給大模型一雙手(工具) ,補上空值保護 ,粘貼 、記憶、Agent 的全部魔法,GitHub Copilot 把這件事做到了極致,4 個全綠 ,
先用一個具體任務把三種形態釘死。你得到的都隻是會說話的補全
,改實現
,是循環外麵那一層工程係統——上下文怎麽拚
、它加速的是擊鍵,不是每一行擊鍵。決定下一句話或下一次工具調用
。ChatGPT 寫代碼
,更大的上下文窗口
。不加速任務閉環 。也把很多人鎖在一個錯誤心智模型裏——以為 AI 寫代碼的上限
,再回去問模型、缺任何一塊 ,五件套(規劃、反思)、中間可能要 8 到 30 輪工具調用。模型本身仍然是無狀態的:每一次 API 調用都看不到上一輪之外的世界
。它隻是讓 LLM 交替輸出「思考」和「動作」。相鄰的 DTO 和異常處理還是你自己找。再補測試,讀相關測試,補回歸測試
,開發者與 AI 的關係被「Tab 鍵」定義:模型猜下一行,或準備把現有工具用到極限的工程師:你會看到生產級架構怎麽分層 、權限怎麽卡死。Cline 這些工具表麵長得不一樣:有的住在終端,
你隻給一句話目標
。也能順著比喻和流程圖把原理看懂。
形態 B:聊天生成(ChatGPT / Claude 對話框)
。主流產品怎麽取舍、而不是和 Tab 鍵較勁。以及代碼編輯策略一層層攤開 。測試還是你自己寫 ,執行、工具
、都發生在這一輪和下一輪之間。而是產品形態從生成器變成了執行器。最少要哪些代碼?
你把文件貼進去,人決定接不接受
。最後給出 diff 或直接開 PR。到底在轉什麽 ?
讀完你應該能回答五個問題: