Rewolucja w kodowaniu: Nowy model NousCoder-14B na fali Claude Code.

Nowy model NousCoder-14B od Nous Research, wytrenowany w zaledwie 4 dni, konkurować będzie z liderem rynku, Claude Code, i zapowiada rewolucję w kodowaniu.
Rewolucja w kodowaniu: Nowy model NousCoder-14B na fali Claude Code
Nous Research, startup AI o otwartym kodzie źródłowym, wspierany przez firmę venture capital Paradigm, opublikował w poniedziałek nowy model do programowania konkurencyjnego, który, jak twierdzi, dorównuje lub przewyższa kilka większych, zastrzeżonych systemów – wytrenowany w zaledwie cztery dni przy użyciu 48 najnowszych procesorów graficznych Nvidia B200. Model o nazwie NousCoder-14B to kolejny z wielu asystentów programistycznych opartych na sztucznej inteligencji, ale pojawia się w szczególnie napiętym momencie: Claude Code, narzędzie programistyczne o agentowym charakterze od konkurenta Anthropic, od dnia Nowego Roku zdominowało dyskusje w mediach społecznościowych, a deweloperzy publikują entuzjastyczne opinie na temat jego możliwości. Równoczesne rozwój tych projektów podkreśla, jak szybko ewoluuje wspomagane przez sztuczną inteligencję tworzenie oprogramowania – i jak zaciekle firmy, zarówno duże, jak i małe, konkurują o to, co wielu uważa za technologię będącą fundamentem pisania oprogramowania.
Wydajność NousCoder-14B
NousCoder-14B osiąga wskaźnik dokładności 67,87 procent w LiveCodeBench v6, ustandaryzowanej ocenie, która testuje modele pod kątem problemów programistycznych związanych z konkursem, opublikowanych między sierpniem 2024 a majem 2025 roku. Ten wynik stanowi 7,08 punktu procentowego poprawę w stosunku do modelu bazowego, na którym był trenowany, Qwen3-14B firmy Alibaba, zgodnie z raportem technicznym Nous Research, opublikowanym wraz z wydaniem.
„Dałem Claude Code’owi opis problemu, a on wygenerował to, co zbudowaliśmy w zeszłym roku w godzinę” – napisał Jaana Dogan, główny inżynier w Google odpowiedzialny za API Gemini, w wiralnym poście na X w zeszłym tygodniu, który oddawał panujący nastrój wokół narzędzi programistycznych AI. Dogan opisywał system orkiestracji rozproszonych agentów, nad którym jego zespół pracował przez rok – system, który Claude Code przybliżył na podstawie trzy-akapitowego promptu.
| Model | Dokładność (LiveCodeBench v6) |
|---|---|
| Qwen3-14B (Alibaba) | 60.79% |
| NousCoder-14B | 67.87% |
Otwarty dostęp i możliwość replikacji
To, co odróżnia wydanie NousCoder-14B od wielu ogłoszeń konkurencji, to jego radykalna otwartość. Nous Research opublikowało nie tylko wagi modelu, ale również pełne środowisko uczenia ze wzmocnieniem, zestaw benchmarków i środowisko treningowe – zbudowane na firmowym frameworku Atropos – umożliwiając każdemu badaczowi z wystarczającą mocą obliczeniową reprodukcję lub rozszerzenie pracy.
„Open-sourcowanie stosu Atropos zapewnia niezbędną infrastrukturę do reprodukowalnych badań olimpijskiego poziomu rozumowania” – zauważył jeden obserwator na X, podsumowując znaczenie dla społeczności akademickiej i open-source.
Niezwykły wgląd w proces treningowy
Model był trenowany przez Joe Li, badacza rezydenta w Nous Research i samego byłego programistę konkurencyjnego. Jego raport techniczny ujawnia nieoczekiwany, osobisty wymiar: porównał on trajektorię poprawy modelu z jego własną podróżą na Codeforces, platformie do programowania konkurencyjnego, gdzie uczestnicy zdobywają rankingi w oparciu o wyniki konkursów.
Na podstawie przybliżonych szacunków mapujących wyniki LiveCodeBench na rankingi Codeforces, Li obliczył, że ulepszenie NousCoder-14B – od zakresu około 1600-1750 punktów do 2100-2200 – odzwierciedla skok, który zajął jemu prawie dwa lata intensywnej praktyki między 14 a 16 rokiem życia. Model osiągnął to w cztery dni.
„Obserwacja, jak przebiegała ta ostatnia faza treningu, była całkiem surrealistycznym doświadczeniem” – napisał Li w raporcie technicznym.
Li szybko zauważył jednak ważną uwagę, która odnosi się do szerszych pytań dotyczących efektywności AI: rozwiązał on około 1000 problemów w ciągu tych dwóch lat, podczas gdy model wymagał 24 000. Ludzie, przynajmniej na razie, pozostają dramatycznie bardziej efektywnymi uczącymi się (sample-efficient learners).
Reinforcement Learning: Złożoność i skala
Proces treningowy NousCoder-14B daje wgląd w coraz bardziej wyrafinowane techniki, których badacze używają do poprawy możliwości rozumowania AI za pomocą uczenia ze wzmocnieniem. Podejście to opiera się na tym, co badacze nazywają „weryfikowalnymi nagrodami” – systemie, w którym model generuje rozwiązania kodu, te rozwiązania są wykonywane w stosunku do przypadków testowych, a model otrzymuje prosty sygnał binarny: prawidłowy lub nieprawidłowy. Ta pętla sprzężenia zwrotnego, choć koncepcyjnie prosta, wymaga znacznej infrastruktury do wykonania na dużą skalę.
Nous Research użyło Modal, platformy obliczeniowej w chmurze, aby uruchomić sandboxowane wykonanie kodu równolegle. Każdy z 24 000 problemów treningowych zawiera średnio setki przypadków testowych, a system musi zweryfikować, czy wygenerowany kod produkuje poprawne wyniki w granicach czasu i pamięci – odpowiednio 15 sekund i 4 gigabajty.
- Weryfikowalne nagrody: Model otrzymuje sygnał binarny (prawidłowy/nieprawidłowy) na podstawie wykonania kodu.
- Skalowalność: Wykorzystanie platformy Modal do równoległego wykonywania kodu.
- Ograniczenia: 15 sekund czasu wykonania i 4 GB pamięci na przypadek testowy.
źródło inteligentnego przedruku: VentureBeat AI