返回文章列表

agent-03 · AI agent 會如何改變研究工作

AI agents 如何改變 research work:first pass 變便宜、verification 變更重要,而 human judgment 移到 problem choice 與 evidence。

本文為 LLM 自動翻譯,原文以 English 版本為準;另有 Lee Hung-yi-inspired English teaching-style version李宏毅老師經典的教學風格版。 如有不通順或誤譯處,建議參照原文。

深色 campaign cover,標題為 AI Agents Change Research Work,並呈現黃色 research workflow 與 document-review loop 圖。

李宏毅 AI agent 系列的第三堂課是最具體的一堂。它問的是 agents 會如何影響工作,然後以學術研究作為例子。

答案不是「AI 寫論文,人類回家」。那太簡單了。更好的答案是:研究會被拆解,而 pipeline 的不同部分會以不同速度改變。

有些部分已經開始變便宜。有些仍然頑固地屬於人類。

Builder takeaway:agents 不是把 research 作為一整塊取代。它們降低 drafts、code、reviews、analysis 的成本,這會讓 verification、problem selection 與 feasibility judgment 更重要。

從 tool 到 coworker,再到 worker

這堂課一開始提出一個有用的演進序列。

深色 blueprint-style 圖,說明 From tool to coworker to worker,包含簡短英文標籤與高對比技術幾何。
這堂課從 tool 到 coworker 再到 worker 的實用 progression 開始。

一開始,AI 是 tool。你給一個 command,它做一件事。

接著 AI 變成 collaborator。你們討論、iterate,並共同產出。

現在 agents 開始像是在有界 tasks 裡工作的 workers。給它們一個 goal、一個 repo、一些 tools,也許還有一份 paper draft,它們就可以自己跑一段時間。

最後這一步改變了工作的形狀。要求 model 摘要一篇 paper 是一回事。要求 agent 檢查 dataset、修改 code、重跑 experiment、寫下結果,並檢查 output 是否符合原始問題,是另一回事。

第二種版本不只是 generation。它是一個 workflow。

100x research assistant 的例子

這堂課中的一個例子,是 Claude Code 使用既有論文的方法和新資料,寫出類似論文的分析。結果並不完美。它至少犯了一個 data mistake。但成本與時間的比較很驚人:大約一小時加上一點錢,對比一位 human research assistant 花上更久時間。

深色 blueprint-style 圖,說明 The 100x research assistant,包含簡短英文標籤與高對比技術幾何。
Research assistant 可以讓 first analysis 變便宜,但不會移除 judgment 的需求。

教訓不是 AI 結果自動比較好。

教訓是,許多研究 tasks 的 first draft 正在變得便宜很多。

這改變了經濟問題。與其比較「AI alone」和「human alone」,更相關的 workflow 可能是:

AI generates first pass
human checks errors
AI revises
human decides if it matters

如果 checking cost 夠低,這會勝過全部手動做。如果 checking cost 很高,或錯誤很 subtle 且危險,那就不一定。

這個區分很重要。Agents 不會消除 verification。它們會讓 verification 更核心。

研究不是單一 task

這堂課以明示與暗示的方式,把研究拆成幾個部分:

深色 blueprint-style 圖,說明 Research is not one task,包含簡短英文標籤與高對比技術幾何。
Research 不是單一 task;agents 會以不同速度改變 workflow 的不同部分。

AI 並不是對所有這些事情都同樣擅長。

它已經在 literature triage、code edits、drafts 與 analysis 上很有用。Autoresearch loops 會讓 agents 修改 training scripts、跑 experiments、查看 results,然後再試一次。這是真實的 leverage。

但 idea generation 更難。

這堂課討論了一些工作:LLM 產生的 research ideas 在 novelty、excitement 與 overall impression 上得分不錯,但 feasibility 較差。這正是我會預期看到的 failure mode。Language models 很擅長把概念組合成聽起來新的東西。真正的測試是 idea 接觸 implementation 之後能不能活下來。

一個美麗但無法執行、測量或證偽的 research idea,大多只是裝飾。

Feasibility bottleneck

這可能是這堂課最重要的部分。

深色 blueprint-style 圖,說明 The feasibility bottleneck,包含簡短英文標籤與高對比技術幾何。
重要瓶頸不是 idea 聽起來是否新,而是它能不能被執行。

AI 可以產生很多 ideas。有些看起來很 novel。有些甚至真的有用。但 feasibility 是 human taste 仍然重要的地方。

這個 experiment 真的跑得起來嗎?

dataset 拿得到嗎?

metric 會回答這個問題嗎?

預期 effect 大到足以偵測嗎?

這是真問題,還只是把詞彙 clever 地重組?

這些問題需要 domain judgment,而不只是 fluency。

這堂課的後續例子是個很好的警告:AI ideas 被實作成短 papers 之後,看起來反而更差。Idea quality 不能只在 pitch stage 判斷。Execution 才會揭露這個 idea 是否有骨架。

AI reviewers 會到來,但真正的問題不在這裡

接著這堂課轉向 AI review。AAAI 2026 被提到作為一個例子:AI reviewers 與 AI meta-reviewers 會成為流程的一部分。

深色 blueprint-style 圖,說明 AI reviewers are coming,包含簡短英文標籤與高對比技術幾何。
AI review 不會自動變糟;糟糕的 review 才糟,無論是誰寫的。

這會讓人憤怒,但這堂課的立場比「AI review 很糟」更 nuanced。

糟糕的 review 就是糟糕。

如果 human reviewer 貼上一份偷懶的 AI-generated review,而且誤解了 paper,那很糟,因為它沒用。如果 AI reviewer 指出真正的缺陷、給出具體建議,並幫助作者改進作品,那就有用。

問題不是文字是否來自 AI。問題是 review 有沒有完成它該做的工作。

話雖如此,系統需要 accountability。Review process 不能變成一串 agents 產出 confident artifacts,卻沒有人負責。必須有人決定批評是否有效。

Deadline-aware review 是被低估的想法

我最喜歡的實務例子之一,是一個會根據 deadline 來 review 學生 papers 的 lab agent。

深色 blueprint-style 圖,說明 Deadline-aware review,包含簡短英文標籤與高對比技術幾何。
Deadline-aware review 有價值,因為 advice 應該符合剩下的時間。

如果 deadline 還很遠,它可以建議更多 experiments。

如果 deadline 是明天,「run three new ablations」就沒有幫助。Agent 應該專注在 clarity、framing、related work,以及 submission 前真正來得及改的地方。

這是一個小例子,但它抓到了良好 agent design 的樣子。Agent 不是在抽象地 evaluation。它是在 human workflow 裡 evaluation。

一個技術上正確的建議,如果忽略時間,也可能完全沒用。

AI Agent for Science 與 partial loop

這堂課也討論 AI Agent for Science:一個 AI 是主要貢獻者,且 AI review 也是流程一部分的實驗設置。

深色 blueprint-style 圖,說明 AI Agent for Science,包含簡短英文標籤與高對比技術幾何。
AI 可以參與 science loop,但不代表它擁有完整 scientific judgment stack。

這指向一種可能的研究 loop:

AI proposes
AI experiments
AI writes
AI reviews
AI revises

把它稱為科學進步的 closed loop 很誘人。

但細節很重要。被接受的工作看起來在早期階段仍然涉及更多 human input:idea selection 與 experiment design。AI 在 data analysis 與 writing 上更強。

這個分工感覺合理。後期 tasks 有更明確的 local feedback。早期的 research taste 比較難被 specify。

人的工作位置會移動

這堂課最強的版本,不是說人類變得不重要,而是說人的工作會移動。

深色 blueprint-style 圖,說明 The human job moves around,包含簡短英文標籤與高對比技術幾何。
最強的 takeaway 不是 human irrelevance,而是 human job 會移動。

如果 AI 讓 drafts、code edits 與 routine analysis 變便宜,那人類價值就會轉向:

這不一定令人安心。有些工作就是建立在執行那些 AI 正在變便宜的部分上。但這比說「researchers 被取代」更準確。

Research 從來不只是寫 papers。最好的 research,是選擇好問題,然後逼現實回答它們。

我會如何改變自己的 workflow

聽完這堂課後,我會更積極地讓 agents 做 first passes,但不會更信任它們。

深色 blueprint-style 圖,說明 What I would change,包含簡短英文標籤與高對比技術幾何。
用 agents 做更多 first passes,但不要因此更信任它們。

這聽起來矛盾。其實不是。

我會讓 agent:

但我會把 human control 保留在:

重點是少花人類時間轉動曲柄,多花人類時間決定哪個曲柄值得轉。

主要教訓

AI agents 不是一波平均打到所有研究工作的單一衝擊。它們是一組 tools,會讓某些步驟變得便宜很多,也讓其他步驟暴露為真正的 bottlenecks。

深色 blueprint-style 圖,說明 The main lesson,包含簡短英文標籤與高對比技術幾何。
AI agents 不是一波平均打到所有研究工作的單一衝擊。

便宜的部分會擴張。我們會產出更多 drafts、更多 experiments、更多 reviews、更多 plots、更多 candidate ideas。

這會讓 taste 更重要,而不是更不重要。

當 output 變便宜,judgment 就會變成稀缺資源。

概念盤點

這堂課涵蓋的主要 research-work 概念:

來源與參考資料

本文觀看的主要來源: