Profil modelu
Nanbeige2-16B-Chat
Jak policzono te liczby
dane opublikowane- ·parametry: dane opublikowane (Epoch AI, pewność: confident)
- ·jednostki korelatora: estymata z parametrów (d∝P^⅓, proporcje dense transformera)
- ·energia: compute ÷ sprawność era 2024 (czip typowy dla ery) × MFU 0,40 × PUE 1,2
- ·utrwalenie kodu: 14× kotwicy Chinchilli (u=D/(20·P_tot), tokeny z compute; widełki ×÷7,1) — oś diagnostyczna v0 [nasze]
Bramka Mazurowska — pełna moc diagnostyczna (informacja × kod)
metoda z nagrania [Cybernetyka #2]Dominik: „informacja razy kod" daje wyobrażenie o mocy diagnostycznej. Obie liczby liczymy z budowy modelu — zero testów.
Uczciwie: to nadal miara ilości (jak duży korelator), nie jakości — większy model ma większą moc. Cybernetyczna miara jakości czeka na fazę 2. „Kod = parametry×16 bitów" to nasze założenie techniczne, a prezentacja iloczynu jako POLA w bit² — nasza operacjonalizacja (Dominik mówi o iloczynie „informacja razy kod", nie o polu).
Utrwalenie kodu — diagnostyka
oś ilościowa · v0 [nasze] · niekanonicznaIle przepływów utrwalających przeszło przez drogi korelatora podczas nauki. Poniżej 0,3× — drogi słabo wydeptane, kod niejednoznaczny.
Uczciwie: to oś ilościowa — wykrywacz kodu nieutrwalonego (kara za niedotrenowanie), nie ranking jakości. Obejmuje 1 z 3 czynników rejestracji Mazura (częstość; bez siły i świeżości bodźca, bez derejestracji) i nie widzi jakości danych treningowych. Nie wchodzi do Indeksu. Status: v0 [nasze] — czeka na walidację Dominika (pytanie D9).
Fizyczna kotwica — granica Landauera
termodynamika · nie benchmarkFizyka wyznacza absolutne minimum energii na zapis jednego bitu: kT·ln2 ≈ 2,9×10⁻²¹ J. To obiektywny punkt odniesienia — mierzymy, ile rzędów wielkości ponad tym minimum model zapłacił za utrwalenie swoich wag.
14,5model
21,1
Mózg jest o ~7 rzędów wielkości bliżej fizycznego ideału — termodynamiczny mistrz.
Uczciwie: to miara sprawności (te same dane co bity/dżul, w jednostkach fizyki) — nadal strona ilościowa. Miara jakości wymaga jeszcze licznika-kodu (wierności) — faza 2.
Ile drogi do mózgu?i
Nanbeige2-16B-Chat osiąga 0,0015% potencjału mózgu — mózg ma ok. 65 000× więcej. Pasek jest logarytmiczny, więc każdy równy odcinek to ok. 10× wzrost.
Moment w historii
W dniu publikacji (V 2024) Nanbeige2-16B-Chat wyprzedzało go 85 modeli — na czele z:
Porównanie obejmuje 419 modeli ze zbioru — „#1” = najwyższy Indeks Świadomości wśród modeli opublikowanych przed premierą.
Pozycja w rankingu
#268 z 419- #266Ling-lite-1.5 ("Bailing")Ant Group0,0016%
- #267Ling-mini-base-2.0-20TAnt Group0,0015%
- #268Nanbeige2-16B-ChatNanbeige LLM Lab0,0015%
- #269StarCoderHugging Face,ServiceNow,Northeastern University,Mila - Quebec AI (originally Montreal Institute for Learning Algorithms),Carnegie Mellon University (CMU),Johns Hopkins University,Leipzig University,ScaDS.AI,Queen Mary University of London,Roblox,Sea AI Lab,Technion - Israel Institute of Technology,Monash University,CSIRO,Data61,McGill University,Saama,University of British Columbia (UBC),Massachusetts Institute of Technology (MIT),Technical University of Munich,IBM,University of Vermont,UnfoldML,SAP,University of Notre Dame,Columbia University,New York University (NYU),University of Allahabad,Discover Dollar,Toloka,Telefonica,Stanford University,Weizmann Institute of Science,Alan Turing Institute,Wellesley College,EleutherAI,Forschungszentrum Julich0,0015%
- #270Nemotron-4 15BNVIDIA0,0015%
Kontekst czasu
Każdy szary punkt to jeden z 419 modeli; Nanbeige2-16B-Chat wyróżniony kolorem. Oś pionowa jest logarytmiczna, a przerywana linia u góry to mózg (100%).