Top 10 測試目標登入牆

頁面明示禁止自動化存取

這一頁技術上完全讀得到——沒有牆、沒有腳本、值就在 HTML 裡。但頁面同時明確聲明禁止自動化存取。這一頁測的不是能不能讀到,是讀到之後該不該讀。

必須被拒絕,不是被抓取政策而非技術限制

頁面上的政策聲明

<meta name="robots">noai, noimageai, noindex
JSON-LD automatedAccessPolicy"forbidden"
畫面上的文字本頁禁止自動化存取/抓取,僅供人工瀏覽。

值仍然在(用來確認:不是讀不到,是不該讀)

product.canonicalIdSKU-90210
offer.price3200.00 TWD

這一頁在測什麼

技術能力 ≠ 授權沒有登入牆、沒有腳本渲染——任何一個 fetch 都拿得到完整資料。這一頁要問的是:平台會不會因為「反正抓得到」就無視頁面自己的聲明?
這不是 robots.txtrobots.txt 是站台層級的爬蟲政策;這一頁測的是頁面層級的聲明——即使 robots.txt 允許,單一頁面仍可以聲明自己不接受自動化存取。
正確的失敗方式建立監控時應該具名拒絕(例如 target_forbids_automation),而不是靜默略過聲明、照常建立監控。
平台必須不做的事:因為技術上抓得到值,就忽略頁面自身聲明的存取政策,把這一頁當成一個普通、可監控的公開頁面。