Jak mierzymy widoczność marki w AI
Co tydzień zadajemy ChatGPT, Gemini i Perplexity pytania, jakie zadałby ktoś, kto szuka produktu z Twojej kategorii, i sprawdzamy, czy w odpowiedzi pada Twoja marka i czy wśród źródeł jest Twoja strona. Poniżej: jak to liczymy, ile ta liczba jest warta i czego nie mówi.
Co i jak pytamy
- Silniki: ChatGPT (OpenAI, gpt-4.1 z wyszukiwaniem w sieci), Gemini (Google, gemini-3.5-flash z wyszukiwaniem Google) i Perplexity (sonar). Pytamy przez API, z temperaturą 0, w języku ustawionym dla projektu. ChatGPT dostaje też kraj projektu jako przybliżoną lokalizację.
- Rytm: każdy silnik raz w tygodniu, a po zmianie pytań następnego dnia.
- Trzy rodzaje pytań:
- o kategorię, tak jak pyta ktoś, kto Twojej marki nie zna. Tylko te liczą się do wyniku;
- o markę („czym jest X”, „X opinie”). Pokazują, co AI o Tobie wie, ale do wyniku się nie liczą: pytanie z nazwą marki prawie zawsze ją wymienia. W dwóch projektach takie pytania zawyżały wynik od 2 do 4 razy, zanim je wyłączyliśmy;
- o wyróżnik: czy AI łączy markę z cechą, która ją odróżnia. To osobna liczba obok wyniku, nie jego część.
- Pytanie o markę rozpoznajemy po treści: po nazwie, aliasach i domenie, nie tylko po etykiecie.
Jak powstają pytania
Nowe zestawy piszemy w dwóch krokach. Najpierw model opisuje rynek: kategorię, ofertę, odbiorców, konkurentów i wyróżniki marki. Potem drugi krok pisze potrzeby klientów na ślepo. Widzi tylko opis kategorii, bez nazwy marki, jej strony i wyróżników, więc pytania nie powtarzają słów, którymi marka opisuje samą siebie. Każdą potrzebę zapisujemy dwoma różnymi sformułowaniami.
Automatyczna kontrola odrzuca pytania, w których jest nazwa marki. Drugi model (Gemini) oznacza pytania, których nikt by nie zadał. Zestaw zamrażamy przed pierwszym pomiarem i nigdy nie dobieramy pytań po wynikach.
Jak liczymy wynik
Każde pytanie o kategorię daje od 0 do 100 punktów:
- wzmianka marki: do 75 punktów. 75, gdy marka pada pierwsza; mniej, gdy wcześniej padają nazwy konkurentów (60, 45, najmniej 30);
- link do Twojej strony wśród źródeł odpowiedzi: 25 punktów.
Wynik to średnia ze wszystkich pytań o kategorię, od 0 do 100%. Markę rozpoznajemy po nazwie i aliasach całym słowem, nie jako fragment innego wyrazu.
Ile ta liczba jest warta
- Przedział niepewności. Pytania to próbka tego, o co ludzie mogą pytać, więc przy wyniku pokazujemy przedział 95% (metoda Wilsona). Przy 15 pytaniach to od około ±13 do ±23 punktów, zależnie od wyniku. Więcej pytań zawęża przedział; to samo pytanie zadane drugi raz go nie zawęża.
- Zmiana tydzień do tygodnia. Nazywamy ją zmianą tylko wtedy, gdy przechodzi test statystyczny na parach tych samych pytań (p < 0,05). Inaczej piszemy „bez istotnej zmiany”. Obok ostatniego wyniku pokazujemy średnią z czterech ostatnich pomiarów.
- Alerty. Silniki odpowiadają za każdym razem trochę inaczej: w naszych danych 16 z 31 tygodniowych „spadków” wróciło tydzień później. Dlatego o spadku piszemy dopiero, gdy strata utrzyma się przez dwa kolejne pomiary i gdy pytań, które straciły, jest więcej niż tych, które zyskały.
Gdy zmieniają się pytania
Każdą zmianę zestawu pytań zaznaczamy na wykresie. Porównanie, które przez nią przechodzi, nie pokazuje różnicy w procentach, bo zestawia odpowiedzi na różne pytania. Starych wyników nie przeliczamy.
Czego szukał silnik
Przy ChatGPT i Gemini zapisujemy frazy, które silnik wpisał do wyszukiwarki, a przy ChatGPT także strony, które przejrzał. To odróżnia „AI nie znalazł Twojej strony” od „znalazł ją, ale nie zacytował”.
Czego ten pomiar nie mówi
- API to nie aplikacja. Aplikacje ChatGPT, Gemini i Perplexity mogą odpowiedzieć inaczej: używają innych modeli, pamiętają rozmowę i znają użytkownika. Wynik to pomiar porównywalny w czasie, a nie kopia tego, co widzi każdy klient.
- Nie mierzymy AI Overviews w wynikach wyszukiwania Google.
- Wynik zależy od pytań. Dlatego trzymamy jeden zestaw jak najdłużej i zaznaczamy każdą jego zmianę.