Powrót
    23 lipca 2026 19:29

    Rewolucja w kodowaniu: Nowy model NousCoder-14B na fali Claude Code.

    Rewolucja w kodowaniu: Nowy model NousCoder-14B na fali Claude Code.

    Nowy model NousCoder-14B od Nous Research, wytrenowany w zaledwie 4 dni, konkurować będzie z liderem rynku, Claude Code, i zapowiada rewolucję w kodowaniu.

    Rewolucja w kodowaniu: Nowy model NousCoder-14B na fali Claude Code

    Nous Research, startup AI o otwartym kodzie źródłowym, wspierany przez firmę venture capital Paradigm, opublikował w poniedziałek nowy model do programowania konkurencyjnego, który, jak twierdzi, dorównuje lub przewyższa kilka większych, zastrzeżonych systemów – wytrenowany w zaledwie cztery dni przy użyciu 48 najnowszych procesorów graficznych Nvidia B200. Model o nazwie NousCoder-14B to kolejny z wielu asystentów programistycznych opartych na sztucznej inteligencji, ale pojawia się w szczególnie napiętym momencie: Claude Code, narzędzie programistyczne o agentowym charakterze od konkurenta Anthropic, od dnia Nowego Roku zdominowało dyskusje w mediach społecznościowych, a deweloperzy publikują entuzjastyczne opinie na temat jego możliwości. Równoczesne rozwój tych projektów podkreśla, jak szybko ewoluuje wspomagane przez sztuczną inteligencję tworzenie oprogramowania – i jak zaciekle firmy, zarówno duże, jak i małe, konkurują o to, co wielu uważa za technologię będącą fundamentem pisania oprogramowania.

    Wydajność NousCoder-14B

    NousCoder-14B osiąga wskaźnik dokładności 67,87 procent w LiveCodeBench v6, ustandaryzowanej ocenie, która testuje modele pod kątem problemów programistycznych związanych z konkursem, opublikowanych między sierpniem 2024 a majem 2025 roku. Ten wynik stanowi 7,08 punktu procentowego poprawę w stosunku do modelu bazowego, na którym był trenowany, Qwen3-14B firmy Alibaba, zgodnie z raportem technicznym Nous Research, opublikowanym wraz z wydaniem.

    „Dałem Claude Code’owi opis problemu, a on wygenerował to, co zbudowaliśmy w zeszłym roku w godzinę” – napisał Jaana Dogan, główny inżynier w Google odpowiedzialny za API Gemini, w wiralnym poście na X w zeszłym tygodniu, który oddawał panujący nastrój wokół narzędzi programistycznych AI. Dogan opisywał system orkiestracji rozproszonych agentów, nad którym jego zespół pracował przez rok – system, który Claude Code przybliżył na podstawie trzy-akapitowego promptu.

    Model Dokładność (LiveCodeBench v6)
    Qwen3-14B (Alibaba) 60.79%
    NousCoder-14B 67.87%

    Otwarty dostęp i możliwość replikacji

    To, co odróżnia wydanie NousCoder-14B od wielu ogłoszeń konkurencji, to jego radykalna otwartość. Nous Research opublikowało nie tylko wagi modelu, ale również pełne środowisko uczenia ze wzmocnieniem, zestaw benchmarków i środowisko treningowe – zbudowane na firmowym frameworku Atropos – umożliwiając każdemu badaczowi z wystarczającą mocą obliczeniową reprodukcję lub rozszerzenie pracy.

    „Open-sourcowanie stosu Atropos zapewnia niezbędną infrastrukturę do reprodukowalnych badań olimpijskiego poziomu rozumowania” – zauważył jeden obserwator na X, podsumowując znaczenie dla społeczności akademickiej i open-source.

    Niezwykły wgląd w proces treningowy

    Model był trenowany przez Joe Li, badacza rezydenta w Nous Research i samego byłego programistę konkurencyjnego. Jego raport techniczny ujawnia nieoczekiwany, osobisty wymiar: porównał on trajektorię poprawy modelu z jego własną podróżą na Codeforces, platformie do programowania konkurencyjnego, gdzie uczestnicy zdobywają rankingi w oparciu o wyniki konkursów.

    Na podstawie przybliżonych szacunków mapujących wyniki LiveCodeBench na rankingi Codeforces, Li obliczył, że ulepszenie NousCoder-14B – od zakresu około 1600-1750 punktów do 2100-2200 – odzwierciedla skok, który zajął jemu prawie dwa lata intensywnej praktyki między 14 a 16 rokiem życia. Model osiągnął to w cztery dni.

    „Obserwacja, jak przebiegała ta ostatnia faza treningu, była całkiem surrealistycznym doświadczeniem” – napisał Li w raporcie technicznym.

    Li szybko zauważył jednak ważną uwagę, która odnosi się do szerszych pytań dotyczących efektywności AI: rozwiązał on około 1000 problemów w ciągu tych dwóch lat, podczas gdy model wymagał 24 000. Ludzie, przynajmniej na razie, pozostają dramatycznie bardziej efektywnymi uczącymi się (sample-efficient learners).

    Reinforcement Learning: Złożoność i skala

    Proces treningowy NousCoder-14B daje wgląd w coraz bardziej wyrafinowane techniki, których badacze używają do poprawy możliwości rozumowania AI za pomocą uczenia ze wzmocnieniem. Podejście to opiera się na tym, co badacze nazywają „weryfikowalnymi nagrodami” – systemie, w którym model generuje rozwiązania kodu, te rozwiązania są wykonywane w stosunku do przypadków testowych, a model otrzymuje prosty sygnał binarny: prawidłowy lub nieprawidłowy. Ta pętla sprzężenia zwrotnego, choć koncepcyjnie prosta, wymaga znacznej infrastruktury do wykonania na dużą skalę.

    Nous Research użyło Modal, platformy obliczeniowej w chmurze, aby uruchomić sandboxowane wykonanie kodu równolegle. Każdy z 24 000 problemów treningowych zawiera średnio setki przypadków testowych, a system musi zweryfikować, czy wygenerowany kod produkuje poprawne wyniki w granicach czasu i pamięci – odpowiednio 15 sekund i 4 gigabajty.

    • Weryfikowalne nagrody: Model otrzymuje sygnał binarny (prawidłowy/nieprawidłowy) na podstawie wykonania kodu.
    • Skalowalność: Wykorzystanie platformy Modal do równoległego wykonywania kodu.
    • Ograniczenia: 15 sekund czasu wykonania i 4 GB pamięci na przypadek testowy.

    źródło inteligentnego przedruku: VentureBeat AI