Nowa.Moda
Gry & Tech

OpenAI liczy pracę agentów jak etaty. To nie znaczy, że badania przyspieszyły trzykrotnie

OpenAI podało, że w połowie sierpnia jego dział badawczy wykorzystywał łącznie 3,1 standardowego ośmiogodzinnego dnia pracy agentów kodujących na każdy dzień pracy ludzi. To wyraźny sygnał zmiany skali automatyzacji, lecz nie dowód, że firma trzykrotnie przyspieszyła tempo odkryć naukowych.

Koncepcyjna ilustracja badacza nadzorującego równoległą pracę kilku modułów AI.
Ilustracja koncepcyjna. Agenci mogą wykonywać równolegle wiele zadań technicznych, ale trudniejsze prace nadal wymagają nadzoru człowieka.

3,1 dnia pracy agentów to miara użycia, nie wynik badań

Materiał opublikowany przez OpenAI 6 września opisuje wewnętrzny, wstępny pomiar wpływu agentów kodujących na badania firmy. Chodzi o narzędzia AI, którym badacze przekazują zadania programistyczne i techniczne: pisanie kodu, diagnozowanie problemów infrastruktury czy monitorowanie eksperymentów.

Do czerwca 2026 r. łączny czas działania agentów w dziale badań był niższy niż łączny czas pracy ludzi. W połowie sierpnia relacja się odwróciła: na jeden dzień ludzkiej pracy przypadało 3,1 ośmiogodzinnego dnia pracy agentów. To pokazuje, ile automatycznego wykonania firma uruchamia równolegle, a nie ile nowych wyników naukowych produkuje.

Różnica jest kluczowa. Agent może przez wiele godzin wykonywać zadanie, które człowiek potem odrzuci, poprawi albo wykorzysta tylko częściowo. Sama liczba „dni pracy” nie mówi więc jeszcze, czy szybciej powstają lepsze modele, trafniejsze hipotezy lub skuteczniejsze wdrożenia.

Skala użycia jest duża, ale człowiek nadal prowadzi trudniejsze zadania

Według OpenAI mediana badaczy korzystała z agentów kodujących codziennie, zużywając w połowie sierpnia ponad 600 dolarów dziennie w cenach API. W 90. percentylu wartość przekraczała 7 tys. dolarów dziennie w tokenach. To nie jest koszt, który da się prosto przełożyć na rachunek zwykłego użytkownika: opisuje intensywność użycia narzędzi wewnątrz zespołu badawczego.

Firma analizowała też powodzenie agentów na zadaniach o różnym poziomie trudności. Od stycznia do lipca skuteczność rosła w kilku przedziałach, ale przy bardziej złożonej pracy nadal potrzebne było istotne sterowanie przez człowieka. Ponad połowa udanych zadań, które człowiek ocenił na cztery do ośmiu godzin pracy, wymagała co najmniej jednej interwencji.

Nie znamy jednak definicji ani skali tej interwencji. Może oznaczać drobną korektę kierunku, lecz może też wymagać poważnej zmiany planu. To ważna luka, bo właśnie w takich momentach rozstrzyga się, czy agent realnie odbiera pracę, czy głównie zwiększa tempo wykonywania zadań pod nadzorem.

Więcej eksperymentów nie przesądza o większym postępie

OpenAI odnotowało wzrost liczby eksperymentów przypadających na aktywnego eksperymentatora w 2026 r.; sierpień był rekordowy w danych zbieranych od stycznia 2025 r. Taki wskaźnik pasuje do tezy, że agenci skracają część pętli badawczej: mogą szybciej przygotować kod, uruchomić test i zebrać techniczne informacje o jego przebiegu.

Firma sama zaznacza jednak, że wzrost zbiegł się zarówno z wdrażaniem Codex, jak i z większą dostępnością mocy obliczeniowej. Nie da się więc z tych danych uczciwie wyciągnąć wniosku, jaka część dodatkowych eksperymentów wynika z agentów, a jaka z większego dostępu do GPU, organizacji pracy lub innych narzędzi.

Do opisu zastosowań OpenAI wykorzystuje podział cyklu badań i rozwoju AI na decyzje, projektowanie, budowanie, uruchamianie, analizę oraz komunikację. Autorzy tej taksonomii z Epoch AI przedstawiają ją jako roboczą propozycję, nie branżowy standard. Pomaga ona nazwać etapy pracy, ale nie zamienia firmowych logów w niezależny pomiar produktywności naukowej.

Najciekawszy sygnał dotyczy sposobu organizacji laboratoriów AI

Wewnętrzne dane OpenAI są niedostępne publicznie, więc nie można ich niezależnie odtworzyć ani zweryfikować. Niezależne źródło potwierdza pochodzenie użytej taksonomii, lecz nie potwierdza wyników firmy. Trzeba też pamiętać, że łatwo policzyć liczbę tokenów, kodu lub uruchomionych eksperymentów, a znacznie trudniej zmierzyć jakość decyzji badawczych.

Mimo tego obraz jest konkretny: agenci kodujący przestają być dodatkiem do pojedynczego zadania i stają się warstwą wykonawczą używaną na dużą skalę. Na razie najlepiej udokumentowana korzyść to większy wolumen technicznej pracy przy zachowanym nadzorze ludzi. Pytanie, czy przełoży się to na proporcjonalnie lepsze wyniki naukowe, pozostaje otwarte.

Źródła