GEO的企鵝時刻:AI搜尋垃圾郵件戰爭已經開始
在2012年4月,Google推出了企鵝更新,瞬間摧毀了一整個連結計畫的產業。那些花了多年時間銷售「連結速度」的代理商醒來時發現他們的客戶被去索引。我目睹了公司在一週內失去80%的自然流量。
GEO 剛剛經歷了它的企鵝時刻。大多數行銷人員還沒有注意到。
簡而言之:一篇名為 GEO-Flag 的新研究論文證明,故意為生成引擎優化 (GEO) 而優化的內容現在在 F1 0.944 可被機器檢測到 — 而且 2026 年修改的頁面中已有 16.36% 顯示 GEO 信號從 2024 年的 7.02% 上升。檢測總是先於懲罰。因為 LLM 仍然天真的「有效技巧」的窗口正在關閉。停止優化機器的感知。開始改善基礎資訊。
我是 James,Mercury Technology Solutions 的 CEO。 來自香港,在這裡我花了去年時間對亞洲品牌進行 GEO 審核 — 並觀察到相同的失敗模式重複出現。
GEO-Flag 實際上證明了什麼?
讓我們具體一點,因為細節很重要。
研究人員建立了一個涵蓋 3,200 個網頁內容實例、400 個查詢、4 個領域和 8 個不同的 GEO 優化器家族的基準 — 然後訓練系統以區分正常內容與故意修改以符合GEO的內容。他們最佳的檢測器達到了0.944的F1分數。
對於非機器學習的群體來說:這不是「相當不錯」。這是生產級的分類。這是平台開始建立執行管道的準確度範圍。
然後他們將檢測器帶入實際環境 — 10,095頁來自1,000個真實用戶查詢來自Google搜尋和Gemini基礎的檢索。事實證明,Google的索引已經帶有可測量的GEO足跡:
修改的年份頁面
估計的GEO普遍性
2024
7.02%
2025
12.80%
2026
16.36%
再讀一次那條趨勢線。GEO 操作正在累積每年大約 5 個點。這正是 2010-2011 年連結垃圾曲線的樣子,就在 Penguin 之前。
模式就是模式:一個有用的信號被發現 → 行銷人員優化它 → 行銷人員濫用它 → 網路充斥著操控 → 偵測趕上 → 品質標準提高。我們正處於第三階段。GEO-Flag 剛剛證明第四階段在技術上已經解決。
GEO 不是垃圾郵件。這是實際的界線。
在恐慌商人開始之前:GEO 本身並不是操控。讓你的內容更清晰、更有結構、更有來源,並且更容易讓 AI 解析,並不是黑帽的任何行為。寫一個好的標題標籤也不是黑帽 SEO。
這條界線比人們想的簡單:
你是在優化機器的感知,還是在改善基礎資訊?
我即將告訴你停止做的所有事情都無法通過這個測試。
H:M 測試
對每個 GEO 變更進行兩個問題的檢視:
- H (人類價值),1–5:這是否讓頁面對讀者真正變得更好?
- M (機器價值),1–5:這是否讓 AI 系統更容易理解和使用這些資訊?
一個清晰的比較表:H5, M5。發佈它。一個有良好來源的統計數據,回答讀者的實際問題:H5, M5。發佈它。僅僅因為你聽說 LLM 偏好引用而添加引用:H1, M4。將每個段落重寫成機械式的兩句 "回答區塊":H2, M4。
如果 M >> H,則假設這次優化有到期日。你不是在建立資產。你是在建立可檢測的模式。
立即停止的五件事
1. 停止製造引用密度
每個人都抓住的第一個GEO見解是「增加更多引用——AI喜歡權威來源。」幾個月內,它變成了每個主張都要有一個連結,每段都以「根據...」開頭,隨意的統計數據像壞水果蛋糕中的葡萄乾一樣被塞進頁面。
GEO-Flag使這變得有趣:研究人員不僅檢查頁面文本。他們審核了來源層級和引用URL的可驗證性。
的6,663 次引用出現 從檢測到的 GEO 頁面中提取,69.34% 收到低可驗證性標籤。在與 Gemini 相關的頁面上:74.15%。
警告:這些是自動審核標籤,並不是證明 69% 是虛構的證據。但信號是明確的——添加證據-查找物件是微不足道的。添加可驗證的證據是困難的。引用數量並不是護城河。證據的質量才是。
2. 停止在各處撰寫 LLM 形狀的內容
你知道這些頁面。什麼是 X?X 是……為什麼 X 重要?X 重要是因為……每個標題都是一個問題,每段兩句話,每個答案都可疑地可引用。
這種結構沒有問題——對於真正是問答的內容。但當你網站上的每一頁都變成一個提取模板時,你就停止了優化溝通,開始優化指紋。
替代方案是我所稱的原生資訊架構 — 讓資訊決定格式:
- 問題 → 直接回答
- 資料 → 表格
- 過程 → 步驟
- 比較 → 矩陣
- 細微差別 → 敘述
- 證據 → 引用
- 意見 → 論點
機器可以很好地解析這些內容。人類能獲得更佳的頁面體驗。這就是整個遊戲。
3. 停止製造共識
這一點讓我最擔心,因為我在現實中不斷看到它。
操作手冊:決定「Acme 是 AI 新創公司的最佳 CRM」,然後製造一篇客座文章來說明這一點、一個 Reddit 帳號來說明這一點、一篇 Medium 文章來說明這一點、一個 Quora 回答來說明這一點、一篇聯盟列表文章來說明這一點。五個來源。一位行銷人員。這不是實體共識 — 這是共識劇場。操盤人手法:這看起來像是一個操作者的行動,直到檢測層追上來,然後它就成為了你品牌名稱上的負擔。
檢測研究正直接朝著識別系統性、協調性的地理干預邁進。分發模式比頁面文本更容易指紋識別。
更艱難、更安全的玩法:創造值得獨立重複的事實。不要發佈「Acme 是 AI 新創公司的最佳 CRM。」發佈「在 418 家使用 Acme 的 AI 新創公司中,中位數銷售管理時間在 90 天後下降了 31%」——並附上方法論。現在記者可以引用它,客戶可以討論它,比較網站可以使用它,AI 可以引用它。
你並沒有製造共識。你製造了能夠創造共識的證據。這是巨大的差別。
4. 停止根據 GEO 檢查清單進行優化
如果你的內容簡報上寫著 ☑ 每個部分 2 個統計數據 ☑ 每 500 字引用一次 ☑ FAQ 架構 ☑ 40 字的回答區塊 ☑ 5 個外部引用——並且你在 500 頁上應用它——恭喜你。你已經在工業規模上創造了一個優化指紋。你已經將帶有你標誌的訓練集交給了檢測器。
用一個要求取代僵化的規則:每一個重要的主張都要有最強有力的可用證據。有時候這是數據。有時候是客戶體驗。有時候是文件。有時候根本不需要引用。
5. 不要僅僅依據引用數量來衡量 GEO 成功
"將 AI 引用增加 40%" 作為團隊目標產生的結果只有一個:更多的回答區塊、更多的合成引用、更多針對微小提示變化的頁面。聽起來熟悉嗎?應該是。SEO 經歷過關鍵字密度、連結數量、精確匹配錨點和字數目標。每一個有用的信號在行銷人員優化代理而不是結果的那一刻就變成垃圾。
以這個順序衡量不同的堆疊:
- 資訊增益 — 我們是否添加了真正新的內容?
- 可驗證性 — 重要的主張是否可以實際檢查?
- 原創性 — 我們是來源,還是重複其他來源?
- 人類效用 — 如果沒有 ChatGPT,這個頁面仍然會是優秀的嗎?
- AI 可見性 — 它會被引用和推薦嗎?
請注意,AI 的可見性排在最後。這是結果,而不是目標。
未來五年的賭注
停止問「我們如何讓 AI 引用這個頁面?」
開始問:「我們如何讓這個頁面成為 AI 可能檢索到的最強有力的證據?」
原始實驗。專有數據集。真實客戶證據。透明的方法論。當前產品事實。有用的比較。這就是我們在 Mercury 的每個 GEO 參與中所構建的 — 不是因為這是美德,而是因為這是唯一能在檢測時代存活下來的版本。你無法通過垃圾郵件檢測來消除真正更好的資訊。
在《銀河英雄傳說》中,楊文利通過使敵人的策略變得無關緊要來獲勝,而不是通過更狡猾的手段。相同的原則。每個詭計在足夠長的時間線上都有對策。質量則沒有。
我的規則,應該也是你的規則:如果一個優化讓 AI 更喜歡這個頁面,但卻讓頁面對人類變得更糟——或沒有改善——那它就有過期日。建立人類想要使用的內容。添加機器可以驗證的事實。創造其他人真正想要重複的證據。讓 AI 的可見性成為結果,而不是技巧。
GEO 垃圾郵件戰爭即將來臨。贏的一方是從不需要發送垃圾郵件的一方。
水星科技解決方案:加速數位化。


