Jak Spotify obniżyło koszty tokenów AI o 90%? Lekcja dla małych firm

Wdrażanie sztucznej inteligencji w codziennej pracy programistów i przedsiębiorców przestało być pieśnią przyszłości, a stało się rynkowym standardem. Narzędzia takie jak Claude Code czy zaawansowane asystenty programistyczne potrafią drastycznie przyspieszyć proces tworzenia oprogramowania, budowy stron internetowych czy automatyzacji procesów biznesowych. Jednak wraz z rosnącą popularnością tych technologii pojawia się wyzwanie, z którym coraz częściej mierzą się zarówno globalne korporacje, jak i lokalne przedsiębiorstwa: lawinowo rosnące koszty tokenów API.
Większość zadań, które wykonuje asystent AI podczas pracy nad kodem, wcale nie wymaga głębokiego, kreatywnego myślenia. To przede wszystkim operacje wejścia/wyjścia (I/O) – takie jak analizowanie pięciu różnych plików tylko po to, by odpowiedzieć na proste pytanie dotyczące jednej metody, generowanie powtarzalnych testów według istniejącego szablonu czy aktualizowanie dokumentacji po spotkaniu. W ten sposób marnowane są tysiące drogich tokenów, podczas gdy zaawansowany, nadwykwalifikowany model wykonuje pracę, z którą bez problemu poradziłoby sobie znacznie tańsze narzędzie.
Inżynierowie ze Spotify znaleźli rozwiązanie tego problemu, tworząc system Portal. Dzięki inteligentnemu delegowaniu zadań i zastosowaniu dedykowanych trybów pracy, udało im się obniżyć zużycie tokenów w Claude Code aż o 90%. To przełomowe podejście pokazuje, że kluczem do rentownego korzystania ze sztucznej inteligencji nie jest rezygnacja z zaawansowanych modeli, ale mądre zarządzanie ich zasobami i kierowanie prostych, powtarzalnych zadań do tańszych alternatyw.
Dlaczego koszty tokenów AI rosną tak szybko?
Aby zrozumieć skalę problemu, warto przyjrzeć się twardym danym z branży technologicznej. Według prognoz, do 2028 roku koszty związane z asystentami AI do kodowania mają przekroczyć średnie wynagrodzenie programisty. Już teraz jedna czwarta liderów inżynierii deklaruje, że wydaje od 200 do 500 dolarów miesięcznie na jednego programistę wyłącznie na tokeny API. W niektórych, skrajnych przypadkach koszty te drastycznie przekraczają granicę 2000 dolarów miesięcznie na osobę.
Główną przyczyną tak wysokich rachunków nie są opłaty licencyjne za same narzędzia, ale właśnie niekontrolowane zużycie tokenów przez zaawansowane modele językowe. Kiedy programista prosi asystenta o drobną modyfikację, model często skanuje całe repozytorium, analizując setki linii kodu, które nie mają bezpośredniego wpływu na zadanie. Spotify zauważyło, że płacenie za tak ogromną liczbę tokenów wejściowych i wyjściowych w najdroższych modelach jest ekonomicznie nieuzasadnione. Rozwiązaniem okazało się stworzenie warstwy pośredniczącej, która potrafi odciążyć główny model.
Portal od Spotify i koncepcja trybów (Modes)
Narzędzie Portal, stworzone przez inżynierów Spotify, wprowadza funkcjonalność o nazwie AiKA Modes. Tryby te to deklaratywni agenci działający w efemerycznych środowiskach uruchomieniowych – koncepcyjnie przypominających usługę AWS Lambda, ale zaprojektowanych specjalnie dla agentów AI. Użytkownik definiuje instrukcje, wybiera model, określa parametry (takie jak temperatura) i podpina narzędzia MCP (Model Context Protocol).
Portal przejmuje na siebie całe zarządzanie infrastrukturą, kluczami API oraz serwerami. Tryby te mogą być wywoływane bezpośrednio z poziomu interfejsu CLI Portalu lub poprzez API, a także mogą być udostępniane publicznie w ramach całej organizacji lub pozostać prywatne. Aby zrealizować plan optymalizacji kosztów, inżynierowie Spotify stworzyli dwa dedykowane tryby, które jako model wykonawczy wykorzystują znacznie tańszy Gemini 2.5 Flash. Rozwiązanie to jest jednak elastyczne – Portal pozwala na podpięcie dowolnego skonfigurowanego modelu.
Dwa tryby, które rewolucjonizują zużycie tokenów
Tryb 1: bulk-reader
Został zaprojektowany z myślą o sytuacjach, w których Claude Code musiałby przeczytać wiele dużych plików tylko po to, by odpowiedzieć na jedno proste pytanie. Instrukcja dla tego trybu definiuje go jako precyzyjnego analityka kodu, którego zadaniem jest przeczytanie dostarczonych plików i zwięzłe odpowiedzenie na pytanie w formie ustrukturyzowanej listy punktowanej. Tryb ten ma surowy zakaz stosowania uprzejmości, wstępów czy zbędnej prozy – każdy punkt musi zaczynać się od dokładnej nazwy, typu lub numeru linii, a temperatura modelu ustawiona jest na 0.2, co gwarantuje maksymalną powtarzalność i precyzję.
Tryb 2: code-writer
Służy on do generowania kodu szablonowego (boilerplate), testów, plików konfiguracyjnych czy definicji typów – czyli wszędzie tam, o ile wynik jest łatwy do przewidzenia na podstawie istniejących wzorców w projekcie. Instrukcja nakazuje modelowi generowanie wyłącznie czystego kodu, bez jakichkolwiek wyjaśnień czy znaczników markdown (chyba że użytkownik wyraźnie o to poprosi). Brak zbędnych opisów i formatowania jest kluczowy, ponieważ zapobiega sytuacji, w której Claude musiałby dodatkowo parsować i przetwarzać zbędny tekst, co generowałoby kolejne koszty.
Jak działa inteligentne przekierowanie? Wtyczka Shunt
Samo stworzenie trybów to dopiero połowa sukcesu – kluczowe było zautomatyzowanie procesu decyzyjnego, kiedy z nich korzystać. Początkowo inżynierowie próbowali opisać zasady routingu w pliku CLAUDE.md. Claude starał się ich przestrzegać, jednak zasady te miały charakter wyłącznie doradczy, a nie wymuszony. Ponadto każdy projekt wymagał kopiowania tych samych instrukcji.
Aby rozwiązać ten problem, stworzono wtyczkę do Claude Code o nazwie shunt. Działa ona na dwóch poziomach:
- Warstwa hooków (Hooks): Wtyczka rejestruje dwa hooki typu PreToolUse, które uruchamiają się przed każdym wywołaniem narzędzia przez Claude. Hook check-file-size monitoruje każdy odczyt pliku. Jeśli rozmiar pliku przekracza określony próg (domyślnie 350 linii), hook blokuje standardowy odczyt i nakazuje Claude użycie narzędzia /bulk-reader. Próg ten można łatwo dostosować za pomocą zmiennej środowiskowej SHUNT_MIN_LINES. Drugi hook, check-bash-read, przechwytuje próby użycia komend systemowych takich jak cat, head, tail, less czy more na dużych plikach, przekierowując je do tańszego modelu.
- Warstwa skryptów (Scripts): Proces obsługiwany jest przez dwa skrypty bash, które opakowują wywołania CLI Portalu. Skrypty te budują zapytania, wywołują akcje, obsługują błędy i raportują dokładne zużycie tokenów do strumienia stderr, dając pełną kontrolę nad kosztami.
Co to oznacza dla małej firmy? Perspektywa biznesowa i lokalna
Choć Spotify to globalny gigant technologiczny, lekcja płynąca z wdrożenia Portalu ma ogromne znaczenie dla sektora małych i średnich przedsiębiorstw, również lokalnie na Śląsku – w miastach takich jak Czechowice-Dziedzice, Bielsko-Biała czy Katowice. Małe firmy coraz chętniej wdrażają automatyzacje oparte na sztucznej inteligencji, aby konkurować z większymi podmiotami. Jednak niekontrolowane koszty subskrypcji i zapytań API mogą szybko zabić rentowność takiego projektu.
Zrozumienie, że nie każde zadanie wymaga najdroższego modelu AI, pozwala na budowanie stabilnych finansowo i efektywnych systemów. Zamiast wysyłać każde zapytanie klienta czy każde zadanie analizy danych do najdroższych modeli GPT-4 czy Claude 3.5 Sonnet, lokalni przedsiębiorcy mogą wdrożyć hybrydowe podejście. Proste zadania, takie jak wstępne filtrowanie zapytań, formatowanie danych czy generowanie powtarzalnych raportów, mogą być delegowane do tańszych i szybszych modeli, takich jak Gemini Flash czy GPT-4o-mini.
W prowebcrafting.com pomagamy firmom z Czechowic-Dziedzic i całego regionu projektować nowoczesne strony internetowe, sklepy online oraz inteligentne automatyzacje AI. Dbamy o to, aby wdrażane przez nas rozwiązania były zoptymalizowane pod kątem kosztów użytkowania. Dzięki odpowiedniej architekturze systemów AI, nasi klienci nie muszą obawiać się nagłego wzrostu rachunków za tokeny, zachowując jednocześnie najwyższą jakość działania asystentów AI w swoich firmach.
Podsumowanie
Przykład Spotify i narzędzia Portal udowadnia, że optymalizacja kosztów AI nie musi wiązać się z pogorszeniem jakości pracy asystentów programistycznych. Kluczem do sukcesu jest inteligentna orkiestracja zadań i delegowanie prostych operacji wejścia/wyjścia do tańszych, wyspecjalizowanych modeli. Dla małych firm planujących wdrożenie sztucznej inteligencji to jasny sygnał: rentowne AI to przede wszystkim AI dobrze zaprojektowane pod kątem architektury i kosztów API.
Zdjęcie: panumas nikhomkhai / Pexels
Najczęstsze pytania
Usługi powiązane z tym tematem
- Automatyzacje AI dla firm — chatbot, auto-odpowiadacz e-mail, rezerwacje i formularz do CRM
Chcesz stronę, która pracuje na Twój biznes?
Zaprojektujemy Ci nowoczesny serwis WWW lub sklep internetowy — z SEO, dobrą konwersją i wsparciem AI.