Blog · · 6 min czytania

Dwa narzędzia, dwa wyniki widoczności w AI. Któremu ufać?

Jedno narzędzie pokazuje 41%, drugie 23% dla tej samej firmy. Skąd ta różnica, co naprawdę mierzy każda liczba i o co zapytać dostawcę pomiaru.

Właściciel firmy sprawdza widoczność w AI w dwóch miejscach. Jedno narzędzie pokazuje, że AI wymienia firmę w 41% odpowiedzi. Drugie, w tym samym tygodniu, podaje 23%. Pierwsza myśl: któreś kłamie. Druga: skoro liczby tak się rozjeżdżają, cały ten pomiar jest nic niewart.

Obie myśli są chybione. Ten przykład z liczbami 41% i 23% pochodzi z tekstu Mike'a Kinga z agencji iPullRank, There Is No „Accuracy” in AI Search Tracking – Only Precision (17 września 2026). Jego teza jest prosta: w odpowiedziach AI nie istnieje jedna „prawdziwa” liczba, do której można przyłożyć wynik narzędzia. Każdy asystent odpowiada za każdym razem trochę inaczej, więc widoczność firmy to rozkład odpowiedzi, a nie stała wartość. Dwa narzędzia z różnymi liczbami najczęściej mierzą po prostu dwie różne rzeczy.

Da się to rozłożyć na części i sprawdzić, która liczba jest dla Ciebie przydatna.

Skąd biorą się różne wyniki

Inne pytania

To największe źródło różnic. Jedno narzędzie pyta „poleć dentystę w Toruniu”, drugie „gdzie w Toruniu zrobić implant zęba z ratami”, trzecie „najlepszy gabinet stomatologiczny w województwie kujawsko-pomorskim”. Na każde z tych pytań asystent wymienia inne firmy. Jeśli nie widzisz listy pytań, nie wiesz, co właściwie zmierzono. Wyniki 41% dla ogólnych pytań i 23% dla pytań o konkretne usługi mogą być jednocześnie prawdziwe.

Inni asystenci i inne tryby

ChatGPT, Gemini, Perplexity i Claude szukają w różnych źródłach, o czym piszemy w tekście Skąd ChatGPT, Gemini i Perplexity biorą polecenia firm. Do tego ChatGPT ma kilka modeli i trybów, a wynik zależy od tego, który z nich odpytano. Narzędzie, które liczy tylko ChatGPT, i narzędzie, które uśrednia czterech asystentów, nie mogą dać tej samej liczby.

Aplikacja a API

Część narzędzi zadaje pytania przez interfejs programistyczny (API), część udaje użytkownika w aplikacji, zalogowanego albo nie. To nie jest ten sam system. W aplikacji dochodzi pamięć poprzednich rozmów, lokalizacja i ustawienia konta. My mierzymy przez API i piszemy to wprost na stronie o metodzie: wynik może różnić się od tego, co zobaczy konkretna osoba w swojej aplikacji.

Inna definicja „wzmianki”

Czy liczy się tylko pełna nazwa firmy? A skrót, którego używają klienci? Link do strony bez nazwy? Nazwisko właściciela? Fragment, który pasuje do dwóch firm o podobnych nazwach? Każde z tych rozstrzygnięć przesuwa wynik. My liczymy nazwę firmy i jej ustalone odmiany, najwyżej raz na odpowiedź, a fragmentu pasującego do kilku firm nie przypisujemy nikomu.

Za mało powtórzeń

Nawet przy tych samych pytaniach i tym samym asystencie wynik z małej próby mocno skacze. Załóżmy, że asystent wymienił firmę w 4 odpowiedziach na 10, czyli w 40%. Przy 95% pewności prawdziwa częstość leży gdzieś między około 17% a 69%. Przy 2 na 10 (20%) ten przedział to około 6–51%. Te dwa przedziały w dużej części się pokrywają, więc „40%” i „20%” z tak małych prób mogą opisywać tę samą firmę w tym samym tygodniu. Nic tu nie jest zepsute, tak działa losowość odpowiedzi.

Dokładność czy powtarzalność

King proponuje rozróżnienie, które łatwo przenieść do codziennej praktyki. Dokładność to bliskość do prawdziwej wartości. Powtarzalność (precyzja) to to, czy ten sam pomiar zrobiony ponownie da zbliżony wynik. Skoro prawdziwej wartości nie ma, pytanie „które narzędzie jest dokładne?” nie ma odpowiedzi. Sensowne jest inne: czy to narzędzie, użyte dwa razy w tych samych warunkach, pokaże podobną liczbę, i czy jego liczba rośnie i spada razem z tym, co dzieje się na rynku?

Dla właściciela firmy przekłada się to na coś bardzo praktycznego. Nie potrzebujesz jednej magicznej liczby. Potrzebujesz liczby, którą da się porównać: z konkurencją dziś i z samym sobą za miesiąc.

Jak to rozwiązujemy w TropAI

Stała seria pytań

Pytania uzgadniamy z klientem, grupujemy w tematy i zapisujemy jako serię. Przy kolejnym pomiarze zadajemy dokładnie tę samą serię. Jeśli zmieniamy pytania, powstaje nowa seria i nie porównujemy jej wyników ze starą. To proste ograniczenie odbiera nam wygodę, ale bez niego nie da się powiedzieć, czy zmiana wyniku to efekt Twoich działań, czy innych pytań.

Powtórzenia i margines błędu

Każde pytanie zadajemy kilka razy, w kilku brzmieniach, każdemu z czterech asystentów. W Audycie to około 720 odpowiedzi. Wynik zawsze podajemy z licznikiem, mianownikiem i przedziałem Wilsona 95%, czyli marginesem błędu dla częstości. Przykład: 41 na 100 odpowiedzi to przedział około 32–51%, 23 na 100 to około 16–32%. Przy 288 na 720, czyli także 40%, przedział zawęża się do około 37–44%. Dopiero przy setkach odpowiedzi różnica między dwoma wynikami przestaje wyglądać jak przypadek.

Konkurencja z tej samej próby

Sama liczba nie mówi, czy jest dobrze. Dlatego obok wyniku firmy pokazujemy, jak często w tych samych odpowiedziach pojawiają się konkurenci. To porównanie jest uczciwe, bo wszyscy zostali „zmierzeni” tymi samymi pytaniami, u tych samych asystentów, tego samego dnia.

Nasz własny przykład: 25 września 2026 roku zadaliśmy 24 pytania o naszą branżę czterem asystentom i zebraliśmy 216 odpowiedzi. Firmę z tej niszy, którą asystenci wymieniali najczęściej, wymienili w 21 z 216 odpowiedzi (około 10%, przedział 6–14%), a TropAI w żadnej (0 z 216, przedział 0–2%). Gdybyśmy podali tylko nasze 0 z 216, wyglądałoby to na klęskę. Obok lidera z 21 na 216 widać, że w tej niszy AI nikogo nie wymienia często.

Każdy asystent osobno

ChatGPT, Gemini, Perplexity i Claude pokazujemy osobno, a Google AI Overviews, tryb AI i Copilot w osobnej części, bez doliczania do wyniku głównego. Jeśli ChatGPT wymienia Cię często, a Perplexity prawie nigdy, to cenna wiadomość, której średnia by nie pokazała.

Pełna lista pytań i zapisane odpowiedzi

W raporcie widzisz każde pytanie, a każda liczba ma za sobą zapisane odpowiedzi. Jeśli wynik Cię dziwi, możesz przeczytać, co asystent napisał, w jakim kontekście padła Twoja nazwa i na jakie źródła się powołał. Jak to wygląda w praktyce, pokazuje przykładowy raport (na danych fikcyjnych).

Pytania do dostawcy pomiaru

Zanim porównasz dwa wyniki albo zapłacisz za jakikolwiek pomiar, zapytaj dostawcę o kilka rzeczy. Część tej listy jest oparta na pytaniach, które proponuje King, część na naszej praktyce. Na część z nich odpowiadają same strony ofert: cenę, liczbę odpowiedzi, asystentów i margines błędu zestawiamy w porównaniu ofert pomiaru, z datą i linkiem do źródła.

  1. Jakie pytania zadajecie? Czy mogę zobaczyć pełną listę i czy brzmią jak pytania moich klientów?
  2. Których asystentów i w jakiej wersji? Czy wynik to jeden asystent, czy średnia kilku? Czy przy zmianie modelu dostanę informację?
  3. API czy aplikacja? Jeśli aplikacja: z konta czy bez, z jakiej lokalizacji?
  4. Ile razy zadajecie każde pytanie? Ile odpowiedzi stoi za podaną liczbą?
  5. Jaki jest margines błędu? Jeśli dostawca podaje sam procent bez przedziału albo bez liczby odpowiedzi, nie wiesz, ile ten procent jest wart.
  6. Co liczycie jako wzmiankę? Nazwa, odmiany, link, nazwisko? Co z firmami o podobnych nazwach?
  7. Czy za miesiąc zadacie te same pytania? Jeśli nie, porównanie „przed i po” niczego nie dowodzi.
  8. Czy dostanę odpowiedzi, z których policzono wynik? Bez nich liczby nie da się sprawdzić.
  9. Jak wypadają konkurenci w tej samej próbie?

Jeśli dwa narzędzia odpowiadają na te pytania inaczej, różne wyniki przestają dziwić. Wybierz to, które odpowiada jawnie, i trzymaj się go przez kolejne pomiary. Zmiana narzędzia w trakcie oznacza, że zaczynasz liczyć od nowa.

Jak samodzielnie zrobić prosty test według tych zasad, opisujemy w poradniku Jak sprawdzić, czy ChatGPT poleca Twoją firmę.

Sprawdź, czy AI wymienia Twoją firmę. Zacznij od darmowego mini-pomiaru: 20 odpowiedzi ChatGPT, Gemini, Perplexity i Claude na frazę, którą wpisują Twoi klienci. Wynik z marginesem błędu dostaniesz e-mailem w ciągu 2 dni roboczych.

Sprawdź za darmo

Pełny pomiar: Szybki test (ok. 200 odpowiedzi, 390 zł netto) albo Audyt (ok. 720 odpowiedzi, konkurencja, dane o firmie i plan działań, 1 490 zł netto). Masz pytanie? Napisz do nas.

Czytaj też

Wszystkie wpisy