大多數 GEO 審核作為一個謎團交付。一副牌降落,一個分數出現,隨後是一系列修正 — 而買家無法知道 AI 可見性分數是被測量還是虛構的。代理機構有充分的動機保持方法的不透明性:如果你無法重現審計,你就無法質疑它,也無法離開。
我們採取相反的做法。這是我們完整的 GEO 審計 方法論 — 每一步,每一個指標,分數是如何計算的,以及五次真實審計中的數字是什麼樣子。百聞不如一見 — 一次看勝過百次描述。如果潛在客戶閱讀這些並自己進行審計,那很好。方法論的可重現性就是產品。
簡而言之: 一個 GEO 審計 回答了大多數報告模糊成一個的兩個問題。方法 A:當 AI 引擎驗證有關您的聲明時,它們能否證實這些聲明?方法 B:當買家提出開放性問題時,AI 是否會自動選擇您?我們對兩者進行 0–100 的評分,將它們融合成統一的分數,並報告差距——因為一個品牌在證實方面可能得分良好,但仍然在每個開放查詢中失利,而這個差距才是真正的診斷。以下是七個步驟、評分,以及來自香港貸款機構 (62)、保險公司(差距在 30 天內從 24 收窄至 4)、一家豪華度假村(70)和一家跨境房地產代理(50)的真實匿名基準——還有 Mercury 自身的軌跡從 69 到 82。
我是 James,Mercury Technology Solutions 的 CEO。我們為企業構建AI 可見性系統——審計、實體基礎設施、持續監控——企業數位轉型的可衡量一半。本次演示中的所有內容都是我們為付費客戶運行的相同過程,僅去掉了客戶名稱。
這是一個GEO 審核實際測量
一個GEO 審核並不是帶有新縮寫的 SEO 審核。SEO 問的是 Google 是否能夠對你的頁面進行排名。GEO 問的是 ChatGPT、Perplexity、Gemini 和 Claude 是否能夠理解、信任並引用你的品牌,當他們組合 AI 答案時。
兩種不同的能力,兩種不同的分數:
統一分數 = 證實 (方法 A) × 選擇 (方法 B) — 而它們之間的差距就是診斷。
方法 A — 證實。AI 能否驗證你的主張?機械層:爬蟲訪問、結構化資料、實體一致性、可提取內容。可借用、可建構、快速。
方法 B — 選擇。當沒有任何強迫時,AI 會選擇你嗎?開放查詢 — "誰是 Y 的最佳 X?" — 是根據模型對實體的先驗知識回答,而不是根據排名。你無法租用這個分數。你必須建立它,否則你就沒有它。
這個差距告訴你你有什麼問題。高 A,低 B:在被命名時可見,在重要時缺失 — 一種租用策略。低 A,適中 B:市場已經在談論你,但機器無法驗證它們所聽到的 — 浪費的權威。相等且低:早期階段,建立基礎。
逐步指南:七個步驟
步驟 1. 建立查詢矩陣。十到三十個買家提示,分為兩類。強制查詢命名品牌("[brand] vs [competitor]","[brand] 是否有授權")— 這些是防禦性查詢。開放查詢僅命名需求("香港最佳第二抵押貸款貸方","哪家保險公司涵蓋既往病症")— 這些是買家實際所在的地方。矩陣的範圍與客戶相關:類別、子類別、三到五個競爭對手的組合,以及市場雙語的兩種語言。該矩陣是審計的合約 — 此步驟之後的所有內容都將以此為基準。
步驟 2. 執行基準。每個提示都經過實時 AI 引擎 — ChatGPT、Perplexity、Gemini、Claude。對於每個答案,我們記錄:品牌提及(是/否)、引用及其來源 URL、答案中的位置、出現的競爭對手,以及關於品牌的任何事實錯誤或幻覺。這產生了「之前」的快照 — 在交付物中最具說服力的頁面,因為高管們信任他們可以滾動的內容。
步驟 3。方法 A — 證實審計。技術現實,手動檢查:GPTBot、ClaudeBot、PerplexityBot 和 Google-Extended 是否在 robots.txt 中明確允許 — 還是默默被阻擋?網站是伺服器渲染的,還是目錄被困在沒有爬蟲執行的 JavaScript 外殼中?我們審計了一個發送真實逐篇 Markdown 管道和 llms.txt 的網站 — 先進、稀有 — 包裹在一個 3KB 的客戶端渲染外殼中,GPTBot 無法讀取。無法讀取的頁面上的先進信號得分為零。然後:架構圖完整性、實體描述一致性、內容可提取性(直接答案是否位於前一百個字中,或在熱身段落下?)、新鮮度信號、網站地圖完整性。
步驟 4。方法 B — 選擇審計。實體層:公司的一致、機器可接受的描述 — Wikidata 存在、Wikipedia 當前、標準簡介鎖定,網站、架構和獨立表面上的事實用相同的詞語表達。評論和社群:是否有任何未關聯的人在 AI 模型閱讀的任何地方提到你?以及聲音地圖 — 最新的模組:當引擎解釋這個類別時,引用了哪些具名的人類,客戶的專業知識是否在其中?AI 引用人,而不僅僅是頁面;一個答案引用五位分析師的類別是一個有五扇門的類別,我們為每一扇門繪製地圖。
步驟 5。基準競爭對手。相同的矩陣,相同的引擎,針對每個競爭者運行。這將絕對分數轉換為位置:62 在領導者為 58 時意味著一件事,而在領導者為 84 時則意味著另一件事。競爭者之間的差距也揭示了白色空間——在 AI 回答中尚未建立的子類別,這是最便宜的切入點。
步驟 6. 評分和診斷。方法 A 和方法 B 在十六個維度上各自得分 0–100(每個引擎的五個即時查詢固定了選擇的一半;技術和實體檢查填補了驗證的一半)。統一分數將它們融合;差距——A 減去 B——是主要數字。我們報告分數、差距、在基準集中的排名,以及驅動最大分數損失的三種失敗模式。
步驟 7. 修正計劃和 90 天的重新審核。發現變成 P0/P1 順序:P0 項目是同週的機械修正(爬蟲白名單、架構修復、描述鎖定);P1 項目是 30/60/90 的結構性工作——實體建設、審查表面、語音地圖捕捉、內容重構。然後是將 GEO 與單頁 SEO 報告區分開的紀律:AI 模型每季度變更,因此審核是季度性的。每次參與都以重新審核日期結束,而不是告別。
收據:五個真實的審核
什麼是 AI 可見性 數字在實踐中看起來如何 — 全部真實,全部匿名:
一個持牌的香港貸款機構:65 / 60 / 統一 62。 AI 已經在五個強制買家查詢中的三個中引用了它們 — 引用存在但沒有實體基礎設施。過時的 2021 年維基百科,沒有 Wikidata,沒有一致的描述。機器引用它們卻無法說明它們是誰。診斷:借用權威,未建構的實體層。
一個香港保險公司:統一 58,差距 4。 一個 30 天的後續:差距曾經是 24。修正序列在一個月內將其縮小了六倍 — 但按產品線拆分顯示旅行得分 64,而 VHIS 則為 42。品牌平均數不可靠;產品層級的審核才是關鍵。
一個豪華度假村:69 / 70 / 統一 70。利基冠軍 — 在「最佳奢華家庭酒店」查詢中排名第三,僅次於兩個全球旗艦。上限不是技術性的;而是獲獎限制。一些差距是用年數來購買的,而不是短跑 — 審計會告訴我們哪些。
一家跨境物業代理:59 / 44 / 統一50,差距 +15。標誌性選擇失敗:真正先進的內容信號,在每個開放的 AI 查詢中都是不可見的。正確的機器,錯誤的答案。
我們的水星:69 → 80 → 82 在三次審計中。我們首先在自己的品牌上運行我們的方法。信任一家發布自己分數趨勢的代理機構。
多麼一個地理審計成本
市場價格獨立的 GEO 審計大約在 $1,500 和 $7,500 之間,取決於查詢矩陣的大小、引擎的覆蓋範圍和語言數量。我們的範圍也是這樣 — 矩陣大小和市場複雜性 — 但有一個結構上的不同:我們將基準審計視為季度節奏的第一個循環,因為一個沒有重新測量的分數就像是一張移動物體的照片。審計要麼成為監控的節奏,要麼只是娛樂。
為什麼我們發布這個方法
羅梅爾的法則:花在偵查上的時間永遠不會浪費。審計就是偵查 — 而你可以檢查的方法就是你可以採取行動的方法。這篇文章中的每個框架 — 查詢矩陣、方法 A/B、差距、聲音地圖 — 都被命名以便可以被引用、測試和辯論。這不是慷慨。一個機器可以提取的方法就是一個被提取的方法 — 而一個展示其工作的機構成為 AI 答案的一部分。
停止購買你無法重現的分數。開始要求帶有數字的方法。
水星科技解決方案:加速數位化。

