agent-03 · AI agent 會如何改變研究工作 — 李宏毅老師經典的教學風格版
受李宏毅教學風格啟發。AI agents 如何改變 research work:first pass 變便宜、verification 變更重要,而 human judgment 移到 problem choice 與 evidence。
本文是受李宏毅教學風格啟發的改寫版本,不是李宏毅老師本人撰寫、審閱或背書。也可閱讀 English 原文、Lee Hung-yi-inspired English teaching-style version 與 繁體中文 一般版本。
各位同學大家好啊,那我們就開始來上課吧。
今天這堂課呢,我們要講的是:agent-03 · AI agent 會如何改變研究工作。
一言以蔽之:AI agents 不會把 research 變成沒有人類的自動工廠,它會讓 first pass 變便宜,然後把瓶頸推到 verification 與 taste。
今天的 roadmap 是:先看 AI 從 tool 變 coworker 再變 worker,接著拆開 research pipeline,看看 first draft、idea、review、experiment design 各自哪裡會變便宜,哪裡反而更需要人。
你可能會想說,這不就是把原本的文章換一種講法嗎?不是。重點是我們要照著一條線走:先看 naive attempt 怎麼壞掉,再看 system 裡哪個 method 或 tooling 出來補洞。這樣你才會知道 failure 應該 debug 在哪一層。
風格說明:本文是受李宏毅教學風格啟發的教學式改寫,不是李宏毅老師本人撰寫、審閱或背書。
從 tool 到 coworker,再到 worker
先從角色變化開始。AI 一開始像工具,後來像同事,現在在某些有界任務裡,開始像 worker。
這堂課一開始提出一個有用的演進序列。
一開始,AI 是 tool。你給一個 command,它做一件事。
接著 AI 變成 collaborator。你們討論、iterate,並共同產出。
現在 agents 開始像是在有界 tasks 裡工作的 workers。給它們一個 goal、一個 repo、一些 tools,也許還有一份 paper draft,它們就可以自己跑一段時間。
最後這一步改變了工作的形狀。要求 model 摘要一篇 paper 是一回事。要求 agent 檢查 dataset、修改 code、重跑 experiment、寫下結果,並檢查 output 是否符合原始問題,是另一回事。
第二種版本不只是 generation。它是一個 workflow。
100x research assistant 的例子
比如說 research assistant。Agent 可以很快做出 first pass,但 first pass 便宜,不代表 truth 便宜。
這堂課中的一個例子,是 Claude Code 使用既有論文的方法和新資料,寫出類似論文的分析。結果並不完美。它至少犯了一個 data mistake。但成本與時間的比較很驚人:大約一小時加上一點錢,對比一位 human research assistant 花上更久時間。
教訓不是 AI 結果自動比較好。
教訓是,許多研究 tasks 的 first draft 正在變得便宜很多。
這改變了經濟問題。與其比較「AI alone」和「human alone」,更相關的 workflow 可能是:
AI generates first pass
human checks errors
AI revises
human decides if it matters
如果 checking cost 夠低,這會勝過全部手動做。如果 checking cost 很高,或錯誤很 subtle 且危險,那就不一定。
這個區分很重要。Agents 不會消除 verification。它們會讓 verification 更核心。
研究不是單一 task
你可能會想說,研究會不會整包被 AI 取代?這個問法太粗了。Research 不是一個 task,而是一串 pipeline。
這堂課以明示與暗示的方式,把研究拆成幾個部分:
- 尋找文獻
- 理解 prior work
- 提出 ideas
- 設計 experiments
- 寫 code
- 執行 models
- 分析 data
- 撰寫 paper
- review paper
- 教學成果
AI 並不是對所有這些事情都同樣擅長。
它已經在 literature triage、code edits、drafts 與 analysis 上很有用。Autoresearch loops 會讓 agents 修改 training scripts、跑 experiments、查看 results,然後再試一次。這是真實的 leverage。
但 idea generation 更難。
這堂課討論了一些工作:LLM 產生的 research ideas 在 novelty、excitement 與 overall impression 上得分不錯,但 feasibility 較差。這正是我會預期看到的 failure mode。Language models 很擅長把概念組合成聽起來新的東西。真正的測試是 idea 接觸 implementation 之後能不能活下來。
一個美麗但無法執行、測量或證偽的 research idea,大多只是裝飾。
Feasibility bottleneck
最麻煩的地方通常不是 idea 聽起來新不新,而是它碰到現實後會不會活。
這可能是這堂課最重要的部分。
AI 可以產生很多 ideas。有些看起來很 novel。有些甚至真的有用。但 feasibility 是 human taste 仍然重要的地方。
這個 experiment 真的跑得起來嗎?
dataset 拿得到嗎?
metric 會回答這個問題嗎?
預期 effect 大到足以偵測嗎?
這是真問題,還只是把詞彙 clever 地重組?
這些問題需要 domain judgment,而不只是 fluency。
這堂課的後續例子是個很好的警告:AI ideas 被實作成短 papers 之後,看起來反而更差。Idea quality 不能只在 pitch stage 判斷。Execution 才會揭露這個 idea 是否有骨架。
AI reviewers 會到來,但真正的問題不在這裡
AI reviewer 這件事會讓人緊張。但核心問題不是文字是不是 AI 寫的,而是 review 有沒有真的完成工作。
接著這堂課轉向 AI review。AAAI 2026 被提到作為一個例子:AI reviewers 與 AI meta-reviewers 會成為流程的一部分。
這會讓人憤怒,但這堂課的立場比「AI review 很糟」更 nuanced。
糟糕的 review 就是糟糕。
如果 human reviewer 貼上一份偷懶的 AI-generated review,而且誤解了 paper,那很糟,因為它沒用。如果 AI reviewer 指出真正的缺陷、給出具體建議,並幫助作者改進作品,那就有用。
問題不是文字是否來自 AI。問題是 review 有沒有完成它該做的工作。
話雖如此,系統需要 accountability。Review process 不能變成一串 agents 產出 confident artifacts,卻沒有人負責。必須有人決定批評是否有效。
Deadline-aware review 是被低估的想法
這裡有一個很好的例子:deadline-aware review。建議不是抽象越完整越好,而是要符合剩下的時間。
我最喜歡的實務例子之一,是一個會根據 deadline 來 review 學生 papers 的 lab agent。
如果 deadline 還很遠,它可以建議更多 experiments。
如果 deadline 是明天,「run three new ablations」就沒有幫助。Agent 應該專注在 clarity、framing、related work,以及 submission 前真正來得及改的地方。
這是一個小例子,但它抓到了良好 agent design 的樣子。Agent 不是在抽象地 evaluation。它是在 human workflow 裡 evaluation。
一個技術上正確的建議,如果忽略時間,也可能完全沒用。
AI Agent for Science 與 partial loop
如果把 proposing、experiment、writing、review 串起來,看起來就像 science loop。但要小心,loop 裡每一段的可靠度不同。
這堂課也討論 AI Agent for Science:一個 AI 是主要貢獻者,且 AI review 也是流程一部分的實驗設置。
這指向一種可能的研究 loop:
AI proposes
AI experiments
AI writes
AI reviews
AI revises
把它稱為科學進步的 closed loop 很誘人。
但細節很重要。被接受的工作看起來在早期階段仍然涉及更多 human input:idea selection 與 experiment design。AI 在 data analysis 與 writing 上更強。
這個分工感覺合理。後期 tasks 有更明確的 local feedback。早期的 research taste 比較難被 specify。
人的工作位置會移動
所以人的工作不是消失,而是位置移動。便宜的是 draft,稀缺的是 judgment。
這堂課最強的版本,不是說人類變得不重要,而是說人的工作會移動。
如果 AI 讓 drafts、code edits 與 routine analysis 變便宜,那人類價值就會轉向:
- 選擇問題
- 設定 research taste
- 設計 experiments
- 檢查 validity
- 決定什麼值得 publish
- 為 errors 承擔責任
這不一定令人安心。有些工作就是建立在執行那些 AI 正在變便宜的部分上。但這比說「researchers 被取代」更準確。
Research 從來不只是寫 papers。最好的 research,是選擇好問題,然後逼現實回答它們。
我會如何改變自己的 workflow
聽完這堂課後,我會更積極地讓 agents 做 first passes,但不會更信任它們。
這聽起來矛盾。其實不是。
我會讓 agent:
- summarize 一組 literature cluster
- draft experiment code
- 建立 baseline implementation
- 產生 tables 與 plots
- 撰寫 related-work section 的 first draft
- review 一篇 paper,找出 obvious gaps
- submission 前跑 checklist
但我會把 human control 保留在:
- 什麼問題重要
- experiment 是否測試了 claim
- result 是否真實
- paper 是否應該存在
重點是少花人類時間轉動曲柄,多花人類時間決定哪個曲柄值得轉。
主要教訓
AI agents 不是一波平均打到所有研究工作的單一衝擊。它們是一組 tools,會讓某些步驟變得便宜很多,也讓其他步驟暴露為真正的 bottlenecks。
便宜的部分會擴張。我們會產出更多 drafts、更多 experiments、更多 reviews、更多 plots、更多 candidate ideas。
這會讓 taste 更重要,而不是更不重要。
當 output 變便宜,judgment 就會變成稀缺資源。
概念盤點
這堂課涵蓋的主要 research-work 概念:
- AI 的角色從 tool,到 collaborator,再到有界自主 worker 的轉變
- Claude Code 風格的 research assistance,用於 data analysis 與 paper drafting
- 100x research assistant 觀念:更便宜的 first passes 加上 human verification
- AI generation 變便宜後,human verification 變成 bottleneck
- autoresearch loops:修改 training scripts、跑 experiments、觀察 results,然後再試一次
- AI-generated research ideas 具有高 novelty 或 excitement,但 feasibility 較低
- surface novelty 與 executable research design 之間的 gap
- conference workflows 中的 AI reviewers 與 AI meta-reviewers
- review quality 才是關鍵,不是 reviewer 是否使用 AI
- deadline-aware review:根據剩餘時間改變建議
- AI Agent for Science 風格 loops,包含 AI authorship 與 AI review
- 四個研究階段:idea、experiment design、data analysis 與 paper writing
- AI 在後期階段更強,在 problem selection 或 experiment design 上較弱
- 人類價值轉向 taste、feasibility judgment、quality control 與 responsibility
來源與參考資料
本文觀看的主要來源: