Caliper

— tok/s idle

System prompt

Tryb

Samplery

0.60
20
0.95
0.00
1.00

Kary za powtórzenia

1.00
0.00
0.00
0.00

Zaawansowane

0.00
0.00

Statystyki generacji

tokeny
czas
throughput
perplexity
śr. entropia
stop
prompt eval
kontekst

Surprisal −log₂p(token). Wysokie słupki = model był zaskoczony własnym wyborem.

Prawdopodobieństwo sekwencji

zakres
tokenów
log₂ P
P(dokładnie ten tekst)
śr. p / token (geom.)
perplexity
najsłabsze ogniwo
bez danych

Iloczyn surowych p(token) — czyli szansa, że model wypluje dokładnie ten ciąg przy czystym samplowaniu w temperature=1. Twoje ustawienia samplerów tego nie zmieniają (rozkłady są surowe), ale zmieniają, jak często taki ciąg realnie wylosujesz.

Zaznaczenie: klik = pierwszy token, Shift+klik = ostatni.

Rozkład tokena

Kliknij token w dowolnej odpowiedzi — także w starszych turach.

Podmiana tokena

Wybierz kandydata przyciskiem na liście wyżej albo wpisz własny tekst. Wszystko za tym tokenem zostanie odcięte, a model pójdzie dalej od nowej wersji.

token  ·  Shift+ zaznacz zakres
kandydat  ·  Enter wymuś kandydata i generuj dalej
PgUpPgDn ±10  ·  HomeEnd skraje  ·  Esc czyść zaznaczenie

Rozkład jest surowy — sprzed samplerów, więc nie zmienia się przy zmianie temperature/top_k/top_p. Samplery decydują tylko o tym, który token zostanie z niego wybrany.

Prompt / Tokenizer

— wyślij wiadomość —

Tunel

Startuje automatycznie razem z panelem i jest wznawiany po awarii — nie musisz nic klikać. Worker łączy się wyłącznie wychodząco, więc to orkiestrator musi mieć publiczny adres.

— tunel nie działa —

Czego potrzebujesz

Podaj model i ile maszyn — backend policzy wymagany VRAM z rozmiaru modelu i wybierze najtańsze karty, które udźwigną go bez kwantyzacji.

Uruchomione instancje

Workery GPU

Worker sam się rejestruje i sam odpytuje o zadania — łączy się wyłącznie wychodząco, więc działa za NAT-em wynajętej instancji bez otwierania portów. Publiczny musi być orkiestrator, stąd tunel.

— podaj URL tunelu —

Model

Podmiana bez restartu procesu. Jeśli nowy model nie wstanie, backend sam wraca do poprzedniego.

Kontekst dzieli się na sloty: ctx/slotów na każdy. Więcej slotów = szybsze benchmarki, mniej kontekstu na rozmowę.

Benchmarki

Losowa próbka z każdego zestawu, ten sam seed = te same pytania, więc modele da się porównać parami.

Każde pytanie idzie jako osobne zapytanie z czystym kontekstem — pakowanie kilku pytań w jeden prompt skaziłoby wynik. Równoległość dotyczy niezależnych zapytań, nie łączenia pytań.
k > 1 uśrednia po losowaniach (avg@k) i wymaga temperature > 0 — przy zerze wszystkie próbki są identyczne. Redukuje wariancję samplowania, ale nie zwiększa liczby pytań: przedział ufności nadal liczy się na pytaniach.

Porównanie — realna poprawa czy szum

Test McNemara na sparowanych pytaniach: liczą się tylko te, w których modele się różnią. Znacznie czulszy niż zestawienie dwóch niezależnych dokładności.