← Wszystkie modele

Profil modelu

StarCoder

Hugging Face,ServiceNow,Northeastern University,Mila - Quebec AI (originally Montreal Institute for Learning Algorithms),Carnegie Mellon University (CMU),Johns Hopkins University,Leipzig University,ScaDS.AI,Queen Mary University of London,Roblox,Sea AI Lab,Technion - Israel Institute of Technology,Monash University,CSIRO,Data61,McGill University,Saama,University of British Columbia (UBC),Massachusetts Institute of Technology (MIT),Technical University of Munich,IBM,University of Vermont,UnfoldML,SAP,University of Notre Dame,Columbia University,New York University (NYU),University of Allahabad,Discover Dollar,Toloka,Telefonica,Stanford University,Weizmann Institute of Science,Alan Turing Institute,Wellesley College,EleutherAI,Forschungszentrum Julich·USA·V 2023·język
popularny lokalniedane opublikowane
Indeks Świadomości
0,0015%
widełki: 0,0007%–0,0034%
Informacja (pojemność)
1,6×10⁷ bitów
widełki: 7,1×10⁶–3,6×10⁷
Energia treningu
90 MWh
widełki: 45 MWh–181 MWhsprzęt: NVIDIA A100 SXM4 80 GB
Sprawność
0,8 bit/J
bitów wzorca z 1 dżula energii treningu

Jak policzono te liczby

dane opublikowane
  • ·parametry: dane opublikowane (Epoch AI, pewność: confident)
  • ·jednostki korelatora: estymata z parametrów (d∝P^⅓, proporcje dense transformera)
  • ·energia: compute ÷ sprawność NVIDIA A100 SXM4 80 GB (zmierzony sprzęt) × MFU 0,40 × PUE 1,2
  • ·utrwalenie kodu: 2,93× kotwicy Chinchilli (u=D/(20·P_tot), tokeny z compute; widełki ×÷7,1) — oś diagnostyczna v0 [nasze]

Bramka Mazurowska — pełna moc diagnostyczna (informacja × kod)

metoda z nagrania [Cybernetyka #2]

Dominik: „informacja razy kod" daje wyobrażenie o mocy diagnostycznej. Obie liczby liczymy z budowy modelu — zero testów.

Informacja
1,6×10⁷
bity — relacje wewnątrz sieci
Kod
2,5×10¹¹
bity — utrwalone wagi
Moc diagnostyczna
1018,6 bit²
pole = informacja × kod

Uczciwie: to nadal miara ilości (jak duży korelator), nie jakości — większy model ma większą moc. Cybernetyczna miara jakości czeka na fazę 2. „Kod = parametry×16 bitów" to nasze założenie techniczne, a prezentacja iloczynu jako POLA w bit² — nasza operacjonalizacja (Dominik mówi o iloczynie „informacja razy kod", nie o polu).

Utrwalenie kodu — diagnostyka

oś ilościowa · v0 [nasze] · niekanoniczna

Ile przepływów utrwalających przeszło przez drogi korelatora podczas nauki. Poniżej 0,3× — drogi słabo wydeptane, kod niejednoznaczny.

Pasmo
pasmo kotwicy
kategoria, nie wyścig
Utrwalenie
2,9×
widełki 0,4×21× · 1× = kotwica Chinchilli
Skala nasycona
75%
50% = kotwica · U% = u/(u+1)

Uczciwie: to oś ilościowa — wykrywacz kodu nieutrwalonego (kara za niedotrenowanie), nie ranking jakości. Obejmuje 1 z 3 czynników rejestracji Mazura (częstość; bez siły i świeżości bodźca, bez derejestracji) i nie widzi jakości danych treningowych. Nie wchodzi do Indeksu. Status: v0 [nasze] — czeka na walidację Dominika (pytanie D9).

Fizyczna kotwica — granica Landauera

termodynamika · nie benchmark

Fizyka wyznacza absolutne minimum energii na zapis jednego bitu: kT·ln2 ≈ 2,9×10⁻²¹ J. To obiektywny punkt odniesienia — mierzymy, ile rzędów wielkości ponad tym minimum model zapłacił za utrwalenie swoich wag.

Fizyczne minimum
7,1×10⁻¹⁰ J
kod × kT·ln2 — mniej się nie da
Realny trening
90 MWh
energia zapłacona naprawdę
Dystans od ideału
20,7 rzędu wielkości
= 10^20,7 × minimum
granica Landauera (0)mózg
14,5
StarCoder
20,7

Mózg jest o ~6 rzędów wielkości bliżej fizycznego ideału — termodynamiczny mistrz.

Uczciwie: to miara sprawności (te same dane co bity/dżul, w jednostkach fizyki) — nadal strona ilościowa. Miara jakości wymaga jeszcze licznika-kodu (wierności) — faza 2.

Ile drogi do mózgu?i

0,0015%
10⁻⁷%
Mózg (100%)

StarCoder osiąga 0,0015% potencjału mózgu — mózg ma ok. 66 000× więcej. Pasek jest logarytmiczny, więc każdy równy odcinek to ok. 10× wzrost.

Moment w historii

W dniu publikacji (V 2023) StarCoder wyprzedzały go 32 modele — na czele z:

W dniu premiery
#33
Do ówczesnego lidera
×27,2
Modeli przed premierą
89

Porównanie obejmuje 419 modeli ze zbioru — „#1” = najwyższy Indeks Świadomości wśród modeli opublikowanych przed premierą.

Pozycja w rankingu

#269 z 419
  1. #267Ling-mini-base-2.0-20T0,0015%
  2. #268Nanbeige2-16B-Chat0,0015%
  3. #269StarCoder0,0015%
  4. #270Nemotron-4 15B0,0015%
  5. #271StarCoder 2 15B0,0015%

Rodzina StarCoder

3 wersje

Od StarCoder (V 2023) do StarCoder 2 7B (II 2024). Punkty na wykresie są klikalne — każdy prowadzi do profilu wersji.

  1. V 2023StarCoder0,0015%
  2. II 2024StarCoder 2 15B0,0015%
  3. II 2024StarCoder 2 7B0,0009%

Kontekst czasu

Każdy szary punkt to jeden z 419 modeli; StarCoder wyróżniony kolorem. Oś pionowa jest logarytmiczna, a przerywana linia u góry to mózg (100%).