瀏覽器 agent 很容易被講成「以後不用寫爬蟲、不用寫 Playwright,叫 AI 去點就好」。
這個說法很吸引人,也很危險。
Stagehand 這類工具真正有意思的地方,不是把瀏覽器操作全部交給 AI,而是承認一件事:有些步驟應該用程式寫死,有些步驟才值得讓模型處理。
這個差別很重要。
如果一個按鈕永遠有固定 selector,請用 code。
如果登入流程、表單欄位、資料抓取位置都穩定,請用 code。
如果頁面結構常變、你只知道目標語意、不知道 DOM 長什麼樣,那才讓 AI 介入。
很多 browser agent 失敗,不是模型太笨,而是任務設計太懶。把所有事情都丟給自然語言,等於每次都讓模型重新猜一次瀏覽器世界。它可能成功,也可能在某個彈窗、cookie banner、A/B test、慢載入元件面前突然迷路。
比較務實的用法是 hybrid:
- 穩定流程用 Playwright/Puppeteer 這種確定性工具
- 不穩定頁面用 AI 做語意定位
- 重要操作前先 preview 或加人工確認
- 能 cache 的頁面理解就 cache,不要每次重猜
- 對失敗情境設 retry 和 fallback,不要假裝 agent 永遠聰明
所以 Stagehand 的價值,不是讓工程師不用寫自動化,而是讓工程師不要為每個脆弱頁面都硬刻 selector。
它適合的不是「我想把整個瀏覽器交給 AI」的團隊,而是已經知道哪些部分該穩、哪些部分會變,然後想把 AI 放在最有彈性的那一段。
真正成熟的 AI browser automation,反而應該看起來沒那麼神奇。
該寫 code 的地方寫 code,該讓模型判斷的地方再讓它判斷。少一點全自動幻想,多一點工程邊界,這類工具才會真的進 production。