Gospodarka oparta na tokenach zderza się z rzeczywistością ekonomii. Niezależnie od tego, czy chodzi o przypadkowy rachunek za wykorzystanie tokenów na pół miliarda dolarów [Axios], czy o wyczerpanie rocznego budżetu na tokeny w ciągu czterech miesięcy [TechCrunch], zespoły finansowe po cichu wdrażają bardziej rygorystyczną kontrolę kosztów po tym, jak sparzyły się na nieprzewidywalnych fakturach związanych ze sztuczną inteligencją.
Chociaż innowacje sprzętowe przez ponad dekadę wyprzedzały prawo Moore’a, nasze ostatnie nawyki konsumpcji AI rosły jeszcze szybciej. Ogromne wolumeny tokenów wymagane przez modele „rozumujące” lub „myślące” przewyższyły przyrosty mocy obliczeniowej. To paradoks Jevonsa w pełnej krasie: gdy moc obliczeniowa staje się bardziej wydajna, po prostu znajdujemy sposoby, by zużywać jej wykładniczo więcej; a zużywanie tokenów jest błędnie traktowane jako wyznacznik innowacji. Prawdziwym wyzwaniem jest optymalizacja pod kątem najwyższego zwrotu z inteligencji poprzez staranne dostosowanie miejsca i sposobu uruchamiania dzisiejszych modeli o wysokim zapotrzebowaniu na moc obliczeniową, tak aby każdy wykorzystany token przekładał się na wyraźny wynik biznesowy.
Kontrola nad kosztami inteligencji ma kluczowe znaczenie dla zachowania konkurencyjności w miarę jak możliwości AI ulegają komodytyzacji. Aby ograniczyć koszty, przedsiębiorstwo musi posiadać własne środowisko operacyjne — infrastrukturę bazową, modele i dane — niezależnie od tego, czy znajdują się one w centrum danych, czy w prywatnej chmurze wirtualnej. Posiadanie własnej infrastruktury zmienia jednostkę rozliczeniową ze zmiennych opłat za tokeny na przewidywalną moc obliczeniową. Samodzielny hosting umożliwia firmom łączenie dużych modeli językowych (LLM) z deterministycznymi systemami danych, w których koszty i przepływy pracy są całkowicie przewidywalne wraz ze wzrostem skali oraz stabilne w przypadku powtarzalnych zadań.
Własność modelu jest równie istotna. Laboratoria komercyjne stoją pod presją optymalizacji punktów końcowych dla konsumentów, ale poleganie na tych zmieniających się punktach końcowych wprowadza nieprzewidywalność w przedsiębiorstwie. Aktualizacje zewnętrznych dostawców mogą zniweczyć logikę biznesową, a wycofywanie modeli wymusza angażowanie nadmiernych zasobów w ponowne testowanie potoków lub płacenie niesubsydiowanych stawek rynkowych. Trenowanie lub dostrajanie na zewnętrznych platformach chmurowych prowadzi do uwięzienia Państwa własności intelektualnej, jeśli nie można wyeksportować wag i dostrojonych adapterów. Niezbędna jest elastyczność umożliwiająca migrację zasobów w przypadku gwałtownego wzrostu cen hostingu lub spadku wydajności. Przenoszenie ogromnych zbiorów danych wiąże się również z opłatami za transfer danych i komplikuje struktury zarządzania danymi przy zmiennych cenach chmury. Zachowanie kontroli nad Państwa środowiskiem i warstwą wnioskowania jest strategiczną koniecznością w celu ochrony bilansu Państwa firmy.
Posiadanie własności zapewnia swobodę optymalizacji tego, co jest uruchamiane i gdzie. Przedsiębiorstwa mogą kierować codzienną automatyzację do zoptymalizowanych małych modeli językowych (SLM), rezerwując jednocześnie zasoby obliczeniowe klasy premium dla złożonych żądań wymagających wnioskowania z wykorzystaniem LLM. Mogą Państwo kontrolować aktualizacje wersji, dostrajać lokalizacje oraz chronić własne prompty i dane przed publicznymi modelami. Ma to największe znaczenie w warstwie wnioskowania, która pochłania większość kosztów obliczeniowych modelu GenAI w całym cyklu jego życia i stanowi główny czynnik kosztowy w przypadku obciążeń produkcyjnych obsługujących chatboty lub długoterminowe agentowe przepływy pracy. Cloudera zapewnia zintegrowaną, kompleksową strukturę obejmującą pełny cykl życia AI w przedsiębiorstwie, od pozyskiwania i przygotowania danych po trenowanie i serwowanie modeli. Obsługa kompleksowej platformy eliminuje koszty fragmentacji wynikające z korzystania z rozwiązań wielu dostawców, a usługa Cloudera AI Inference stanowi kluczowy atut.
Na poziomie indywidualnym obliczenie precyzyjnego zwrotu z inteligencji dla użycia modeli LLM jest trudne. Indywidualny wybór bywa subiektywny i wysoce zależny od kontekstu, składając się głównie z jednorazowych zapytań badawczych, doraźnych par pytań i odpowiedzi lub prototypów budowanych w trybie programowania koncepcyjnego. W przeciwieństwie do tego, powtarzalne korporacyjne przepływy pracy związane z danymi są wysoce ustrukturyzowane, z dobrze zdefiniowanymi zadaniami i oczekiwanymi wynikami. Potoki nie wymagają ogromnych modeli ogólnego przeznaczenia; mniejsze, szybsze modele zapewniają mniejsze opóźnienia i wyższą przepustowość, jednocześnie maksymalizując wydajność sprzętu. Cloudera ocenia te aspekty ekonomiczne poprzez prywatną sztuczną inteligencję (private AI), zapewniając prywatność dzięki zarządzaniu platformą przy jednoczesnym zachowaniu własności danych i punktów końcowych modeli.
Gdy przedsiębiorstwo obsługuje produkcyjne obciążenia robocze o dużej skali — takie jak uruchamianie na dużą skalę modeli najwyższej klasy o 70 miliardach parametrów — skumulowany całkowity koszt posiadania szybko zaczyna odbiegać od kosztów API ofert chmury publicznej rozliczanych za tokeny. Na podstawie ocen środowisk korporacyjnych o wysokim stopniu wykorzystania, wdrażanie wnioskowania w infrastrukturze prywatnej zapewnia wyraźną przewagę kosztową nad ponoszeniem zewnętrznych opłat za tokeny, gdy tylko firma przekroczy określony wolumen obciążeń.
Aby zilustrować, jak te aspekty ekonomiczne funkcjonują w praktyce, warto rozważyć agentowy przepływ pracy pomocnika (co-pilot) do zarządzania majątkiem, obsługującego długoterminowe, wieloetapowe przepływy pracy, takie jak przygotowanie do spotkań, weryfikacja KYC, rebalansowanie portfela i aktualizacje CRM. Pojedynczy menedżer może z łatwością wykorzystać ponad 70 milionów tokenów miesięcznie. Na dużą skalę uruchomienie tego asystenta za pośrednictwem publicznych API jest ponad 4-krotnie droższe niż wdrożenie prywatnego wnioskowania AI.
Należy pamiętać, że są to szacunki poglądowe, skupione na konkretnym modelu, liczbie parametrów i konfiguracji obliczeniowej. Możliwości modeli zmieniają się dynamicznie, a mniejsze, wyspecjalizowane modele otwarte często w ciągu zaledwie kilku miesięcy przewyższają wczorajsze potężne silniki ogólnego przeznaczenia. Oszczędności będą się różnić w zależności od złożoności wnioskowania, stosunku liczby tokenów wejściowych do wyjściowych oraz konfiguracji podstawowego sprzętu.
Jednak teza finansowa pozostaje niezmienna: w przypadku powtarzalnej automatyzacji klasy korporacyjnej prywatna obsługa modeli eliminuje nieprzewidywalną karę cenową wynikającą z opłat za publiczne tokeny, umożliwiając firmom zrównoważone skalowanie aplikacji AI.
Okres nieograniczonego eksperymentowania z punktami końcowymi AI w chmurze publicznej w modelu płatności za rzeczywiste użycie dobiega końca. W miarę jak przedsiębiorstwa przechodzą od pilotaży badawczych do stabilnej produkcji, kryteria oceny muszą wykraczać poza prostą dokładność modelu i uwzględniać przewidywalną ekonomikę AI.
Maksymalizacja Państwa zwrotu z inteligencji oznacza przejście z ram, w których nieustannie wynajmują Państwo modele zewnętrzne lub ryzykują niekontrolowane zużycie tokenów, na model, w którym stają się Państwo właścicielami swoich podstawowych zasobów obliczeniowych i optymalizują je. Zachowując kontrolę nad podstawowymi danymi, własnymi dostosowanymi modelami i stosem wnioskowania, Państwa organizacja może swobodnie skalować przepływy pracy AI bez ryzyka nieprzewidzianego przekroczenia kosztów. Efektywność operacyjna jest fundamentem niezbędnym do dostarczania zrównoważonych rozwiązań AI klasy korporacyjnej na dużą skalę.
Warto dołączyć do nas podczas nadchodzącego wydarzenia ClouderaNOW, aby dowiedzieć się więcej o tym, jak możemy to umożliwić Państwa organizacji.
This may have been caused by one of the following: