TL;DR: Tidak ada skor visibilitas AI lintas platform tunggal, dan dasbor mana pun yang menjual satu kepada Anda sedang menyembunyikan metodologinya. Ukur tiga hal — Tingkat Kutipan, Pangsa Suara kompetitif, dan Prominensi — di bawah protokol tetap: set prompt beku, platform bernama, pasar, bahasa, jumlah run, aturan pengecualian, semua didefinisikan sebelum pengujian dimulai. Tetapkan baseline, pelajari lantai kebisingan Anda, dan hanya kemudian sebut perubahan sebagai perbaikan.
Saya James, CEO dari Mercury Technology Solutions. Kalimat termahal dalam SEO AI saat ini adalah "skor visibilitas AI Anda adalah 70." Tujuh puluh apa, diukur bagaimana, terhadap prompt mana, di platform mana, di pasar mana, dalam bahasa apa? Skor tanpa protokol adalah astrologi dengan dasbor. Berikut adalah kerangka pengukuran GEO yang sebenarnya kami jalankan — dan aturan yang menjaga kejujurannya.
Tiga Metrik Inti
1. Tingkat Kutipan: Seberapa Sering Jawaban AI Mengutip Domain Anda?
Tingkat Kutipan = jumlah run valid yang mengutip domain Anda ÷ total run valid.
18 run yang dikutip ÷ 60 run valid = 30% Tingkat Kutipan. Persentase hanya menjadi berarti ketika penyebutnya jelas. Enam puluh prompt diuji sekali dan tiga puluh prompt diuji dua kali keduanya menghasilkan 60 run — mereka bukan pengukuran yang sama. Platform, pasar, bahasa, dan jumlah run semua mengubah arti angka tersebut — itulah sebabnya, dalam laporan GEO yang serius, Tingkat Kutipan tidak pernah muncul tanpa protokol yang menyertainya.
2. Pangsa Suara Kompetitif: Seberapa Sering Anda Muncul vs Pesaing yang Dinamai?
Pangsa SOV Kompetitif = penampilan merek Anda ÷ total penampilan oleh merek Anda ditambah set pesaing yang tetap dan dinamai. Jika Anda muncul 35 kali dan pesaing yang dinamai muncul 65 kali secara keseluruhan: 35%.
Dua aturan membuat ini dapat dibandingkan. Pertama, set pesaing tetap beku antara periode — membandingkan diri Anda dengan tiga pesaing pada bulan Januari dan sepuluh pada bulan Maret menghasilkan dua angka yang berbagi rumus dan tidak ada yang lain. Kedua, satu penampilan merek per run, apakah jawaban menyebut Anda sekali atau lima kali.
3. Prominensi: Peran Apa yang Anda Mainkan dalam Jawaban?
Tingkat Kutipan menghitung keberadaan; Prominensi mengklasifikasikannya. Empat level:
| Level | Klasifikasi | Aturan | |---|---|---| | P1 | Rekomendasi utama | Merek adalah rekomendasi utama | | P2 | Alternatif yang disebutkan | Salah satu dari beberapa opsi, tidak jelas utama | | P3 | Sumber yang dikutip | Domain yang dikutip untuk mendukung fakta; merek tidak direkomendasikan | | P4 | Sebutan lewat | Disebutkan tanpa atribusi atau rekomendasi |
"Merek A adalah rekomendasi utama kami. Merek B dan C juga layak dipertimbangkan" — A adalah P1, B dan C adalah P2. Jika perannya benar-benar ambigu, klasifikasikan ke bawah. Meninggikan prominensi Anda sendiri adalah cara program pengukuran berbohong kepada diri mereka sendiri.
Aturan Pengukuran yang Menjaga Kejujuran
Apa yang dihitung sebagai run yang valid. Respon lengkap di bawah kondisi yang dimaksud — prompt penuh diajukan, platform yang tepat, pasar yang tepat, bahasa yang tepat, tanpa pemotongan. Setiap run yang dikecualikan dicatat dengan alasannya. Dan aturan kardinal: jangan pernah menjalankan ulang prompt yang gagal sampai Anda mendapatkan jawaban yang Anda suka. Itu bukan pengukuran; itu berbelanja.
Kutipan dan sebutan adalah bidang terpisah.Sebuah kutipan mengaitkan informasi ke domain Anda atau menghubungkannya sebagai sumber. Sebuah penyebutan menyebutkan Anda tanpa atribusi. Tidak dikutip ≠ tidak disebutkan — model dapat menyebutkan Anda dari data pelatihan tanpa pernah menyentuh situs Anda. Gabungkan keduanya menjadi satu metrik "penampilan" dan Anda telah menghancurkan perbedaan yang memberi tahu Anda apakah konten berfungsi.
Penampilan yang diulang dihitung sekali per run. Tiga tautan ke domain Anda dalam satu jawaban = satu run yang dikutip. Prominensi tambahan ditangkap dalam Prominensi, bukan dengan menggelembungkan jumlah.
Lantai Kebisingan: Angka yang Tidak Ingin Diterbitkan Siapa Pun
Jalankan set prompt beku yang sama dua kali di bawah kondisi identik. Garis Dasar 1: 30% Tingkat Kutipan. Garis Dasar 2: 27%. Selisih 3 poin itu adalah lantai kebisingan yang Anda amati — jumlah visibilitas AI bergerak ketika tidak ada yang berubah secara sengaja.
Sekarang disiplin: jika pengukuran selanjutnya bergerak dari 30% ke 32%, itu bukanlah sebuah perbaikan.Ini ada di dalam kebisingan. Simpan garis dasar individu dalam laporan — jangan hanya rata-rata — karena lantai kebisingan itu sendiri bergeser seiring waktu. Ini bukan interval kepercayaan formal; ini adalah ukuran variasi yang diamati yang memisahkan sinyal dari cuaca. Setiap agensi SEO AI yang melaporkan "keuntungan" bulan ke bulan yang lebih kecil dari lantai kebisingannya sendiri sedang menjual variasi sebagai kemajuan.
Protokol Pengambilan Sampel Adalah Bagian dari Pengukuran
Sebelum mempercayai angka apa pun — milik Anda, milik vendor, milik kami — protokol harus menyebutkan: kata-kata prompt yang tepat, platform dan permukaan AI, pasar dan lokasi, bahasa, jumlah percobaan per prompt, set pesaing, jendela pengujian dan ritme, pengaturan akun/personalisasi, definisi kutipan dan penyebutan, aturan penghitungan, dan aturan pengecualian.
Ubah salah satu dari mereka antara putaran dan dua putaran tidak dapat dibandingkan — bahkan dengan nama metrik yang sama. Protokol ini adalah perbedaan nyata antara pelaporan SEO dan pelaporan GEO: peringkat memiliki satu sumber kebenaran; kutipan tidak memiliki. Bahasa layak mendapat penekanan khusus: prompt dalam bahasa Inggris dan prompt dalam bahasa Mandarin Tradisional tidak mengambil dokumen yang sama. Mereka adalah dua pengukuran, bukan satu. Campurkan mereka dan Anda telah merata-ratakan dua sistem yang tidak terkait.
Di Mana Data Pihak Pertama Sesuai
Laporan Kinerja AI Generatif Google Search Console dan data Kinerja AI Bing Webmaster Tools adalah bukti pihak pertama untuk platform mereka sendiri — tayangan di satu sisi, kutipan dan kueri dasar di sisi lain. Mereka nyata, tetapi terkunci pada platform. Perbandingan lintas platform antara ChatGPT, Perplexity, dan Gemini masih memerlukan pengambilan sampel prompt di bawah protokol Anda sendiri. Tidak ada yang menggantikan yang lain.
Untuk program pengukuran kecil hingga menengah: 30–60 prompt tetap, percobaan berulang, ritme triwulanan, aturan satu analis yang ditulis. Itu cukup untuk memisahkan gerakan dari kebisingan — dan itulah yang terlihat seperti program pengukuran SEO AI yang serius. Ini adalah protokol di balik kami Audit GEO — dasar 48 jam yang menjadi titik awal setiap keterlibatan — dan lapisan KPI didokumentasikan dalam kerangka KPI LLM. Jika Anda ingin melihat pengukuran sebelum membelinya, jalankan Kartu Skor GEO.
Hentikan pengumpulan skor. Mulailah menerbitkan protokol.
Solusi Teknologi Mercury: Percepat Digitalitas.
