Stagehand 這類瀏覽器 agent 工具,真正該學的是少用 AI

工具/框架快評:AI browser automation 的重點不是全交給模型,而是把確定流程留給程式,把不確定頁面交給自然語言。

瀏覽器 agent 很容易被講成「以後不用寫爬蟲、不用寫 Playwright,叫 AI 去點就好」。

這個說法很吸引人,也很危險。

Stagehand 這類工具真正有意思的地方,不是把瀏覽器操作全部交給 AI,而是承認一件事:有些步驟應該用程式寫死,有些步驟才值得讓模型處理。

這個差別很重要。

如果一個按鈕永遠有固定 selector,請用 code。
如果登入流程、表單欄位、資料抓取位置都穩定,請用 code。
如果頁面結構常變、你只知道目標語意、不知道 DOM 長什麼樣,那才讓 AI 介入。

很多 browser agent 失敗,不是模型太笨,而是任務設計太懶。把所有事情都丟給自然語言,等於每次都讓模型重新猜一次瀏覽器世界。它可能成功,也可能在某個彈窗、cookie banner、A/B test、慢載入元件面前突然迷路。

比較務實的用法是 hybrid:

  • 穩定流程用 Playwright/Puppeteer 這種確定性工具
  • 不穩定頁面用 AI 做語意定位
  • 重要操作前先 preview 或加人工確認
  • 能 cache 的頁面理解就 cache,不要每次重猜
  • 對失敗情境設 retry 和 fallback,不要假裝 agent 永遠聰明

所以 Stagehand 的價值,不是讓工程師不用寫自動化,而是讓工程師不要為每個脆弱頁面都硬刻 selector。

它適合的不是「我想把整個瀏覽器交給 AI」的團隊,而是已經知道哪些部分該穩、哪些部分會變,然後想把 AI 放在最有彈性的那一段。

真正成熟的 AI browser automation,反而應該看起來沒那麼神奇。

該寫 code 的地方寫 code,該讓模型判斷的地方再讓它判斷。少一點全自動幻想,多一點工程邊界,這類工具才會真的進 production。

換個腦袋讀

想再讀深一點?

深入解讀
ChatGPT Google AI

相關文章