Together AI, wnioskowanie na cudzych modelach
Together AI to dostawca wnioskowania: udostępnia cudze modele o otwartych wagach przez API zgodne z OpenAI, dokłada dostrajanie i wynajem GPU. Klient Pythona together ma wersję 2.31.0 na licencji Apache 2.0, klient TypeScriptu together-ai wersję 0.49.0 na tej samej licencji. Licencja klienta nie mówi jednak nic o licencji modelu, który wywołujesz, i to jest najważniejsza rzecz do zrozumienia przy tej platformie.
Co Together AI sprzedaje, a czego nie
Oferta dzieli się na cztery produkty rozliczane osobno. Wnioskowanie serwerless to wywołania za token na współdzielonej infrastrukturze, bez rezerwowania czegokolwiek. Dedykowane wnioskowanie to model postawiony na wydzielonym sprzęcie, rozliczany za godzinę GPU. Klastry GPU to surowe maszyny na godziny lub na dłuższe okresy rezerwacji. Do tego dochodzi dostrajanie, rozliczane za tokeny zbioru treningowego.
Katalog serwerless jest węższy, niż sugeruje hasło o setkach modeli. W dokumentacyjnej tabeli modeli czatowych doliczyłem się dwudziestu czterech pozycji, między innymi openai/gpt-oss-120b, meta-llama/Llama-3.3-70B-Instruct-Turbo, Qwen/Qwen3.5-397B-A17B, moonshotai/Kimi-K3, zai-org/GLM-5.2 i deepseek-ai/DeepSeek-V4-Pro. Modeli obrazu i wideo jest po kilkadziesiąt. Za to modeli osadzeń jest w serwerless dokładnie jeden, intfloat/multilingual-e5-large-instruct po 0,02 USD za milion tokenów, a modeli przestawiających wyniki wyszukiwania nie ma tam wcale: dokumentacja kieruje po nie do wnioskowania dedykowanego. Jeśli budujesz wyszukiwanie z etapem rerankingu, ta jedna linijka w dokumentacji przesądza o architekturze.
Czego Together nie robi: nie ma wariantu instalowanego u siebie. Nie ma też własnych modeli, które byłyby powodem, by tu zostać. Cała wartość leży w tym, że ktoś inny utrzymuje serwery i aktualizuje katalog, a Ty płacisz za token. To zarazem główne ryzyko: model, na którym oprzesz produkt, może zniknąć z katalogu, a wtedy zostaje Ci przepisanie identyfikatora modelu i ponowna ewaluacja jakości.
Pakiety, wersje i licencje klientów
Nazwy pakietów są niesymetryczne i to pierwsza pułapka. Na PyPI oficjalny pakiet nazywa się together, na npm together-ai. Odwrotne nazwy nie działają: together-ai na PyPI nie istnieje, a together na npm to niezwiązany pakiet do składania HTML w wersji 0.0.11, ostatnio wydany 25 listopada 2014 roku, na licencji MIT. Instalacja z pomyloną nazwą nie zakończy się błędem, tylko zaciągnie coś zupełnie innego.
# Python: pakiet nazywa sie together, nie together-ai
pip install together
# TypeScript: pakiet nazywa sie together-ai, nie together
npm install together-ai
# sprawdzenie, co faktycznie sie zainstalowalo
pip show together | head -3
npm view together-ai version license repository.url
# klient Pythona instaluje dwa polecenia terminalowe
together --help
tg --helpWeryfikacja licencji z trzech źródeł wypada tu wzorcowo, co przy tej kolekcji nie jest regułą. Plik LICENSE w repozytorium togethercomputer/together-py zawiera pełny tekst Apache 2.0 z wypełnioną notą „Copyright 2026 Together”. Pole license w rejestrach ma wartość Apache-2.0 po obu stronach. Opublikowane paczki zawierają ten sam plik: archiwum źródłowe i koło Pythona mają LICENSE w katalogu głównym i w dist-info/licenses, paczka npm ma LICENSE w katalogu głównym. Kod w paczkach jest, nie są to puste zaślepki.
Dwa drobiazgi z rozpakowanych paczek zasługują na wzmiankę. W paczce npm siedzi dodatkowy plik src/internal/qs/LICENSE.md na licencji BSD 3-Clause, należący do wcielonej kopii biblioteki neoqs; przy audycie zależności trzeba go wpisać osobno. Drugi drobiazg jest po stronie Pythona: obowiązkowa zależność detect-agent w wersji 0.6.0 nie ma na PyPI ani pola license, ani klasyfikatora licencji, choć w kole znajduje się plik Apache 2.0 z tą samą notą „Copyright 2026 Together”. Skaner licencji patrzący wyłącznie na metadane rejestru zgłosi tę zależność jako nieustaloną.
Repozytoria to osobna pułapka. Kod klienta Pythona 2.x leży w togethercomputer/together-py. Starsze togethercomputer/together-python nadal istnieje pod własnym adresem, nie przekierowuje, a jego ostatnie wydanie to v1.5.35 z 21 stycznia 2026 roku. Plik LICENSE w tym starym repozytorium ma niewypełniony szablon Apache z frazą „Copyright [yyyy] [name of copyright owner]”. Wskazywanie go dziś jako repozytorium klienta jest po prostu nieaktualne. Do tego plik README.md w paczce 2.31.0 deklaruje wymóg Pythona 3.9 lub nowszego, podczas gdy pyproject.toml w tej samej paczce ma requires-python = ">= 3.10". Obowiązuje wersja z pyproject.toml, bo to ona blokuje instalację.
Licencja SDK to nie licencja modelu
Apache 2.0 na kliencie dotyczy kodu klienta. Model, który wywołujesz przez ten kod, ma własne warunki i to Ty jesteś ich adresatem, nie Together. Platforma nie przejmuje odpowiedzialności za to, że użyjesz modelu wbrew jego licencji.
Together publikuje licencję modelu w API, ale nie w dokumentacji. Endpoint GET /v1/models zwraca obiekt z opcjonalnym polem license obok organization, context_length, link oraz zagnieżdżonego pricing z polami input, output, cached_input, base, finetune i hourly. Natomiast tabela katalogu w dokumentacji ma kolumny na kontekst, ceny, kwantyzację i wywoływanie funkcji, a kolumny z licencją nie ma wcale. Strony poszczególnych modeli na witrynie też nie pokazują tekstu licencyjnego. Praktyczny wniosek: licencję trzeba wyciągnąć z API albo sprawdzić u autora wag.
import os
from together import Together
client = Together(api_key=os.environ["TOGETHER_API_KEY"])
for model in client.models.list():
if model.type != "chat":
continue
price = model.pricing
print(
model.id,
model.organization,
model.license or "brak pola license",
price.input if price else None,
price.output if price else None,
sep=" | ",
)Dlaczego to nie jest formalność, pokazują trzy modele z katalogu serwerless. openai/gpt-oss-120b i Qwen/Qwen3.5-397B-A17B mają na Hugging Face licencję Apache 2.0, zai-org/GLM-5.2 oraz deepseek-ai/DeepSeek-V4-Pro mają MIT. Do tego momentu nic się nie dzieje. Ale meta-llama/Llama-3.3-70B-Instruct ma znacznik license: llama3.3, czyli własną licencję społecznościową Meta z osobnymi warunkami, a nie jedną z licencji permisywnych.
Dwa modele idą jeszcze dalej i mają progi przychodowe wpisane w tekst. Wagi Qwen/Qwen3.8-2.4T-A95B są objęte licencją własną o nazwie Qwen3.8-Max License. Wymaga ona, by przy produkcie mającym ponad 100 milionów aktywnych użytkowników miesięcznie albo ponad 20 milionów dolarów miesięcznego przychodu nazwa modelu była widoczna w interfejsie. Osobno: jeśli licencjobiorca prowadzi działalność typu Model as a Service albo asystenta pracy opartego na AI, a łączny przychód jego i podmiotów powiązanych przekracza 50 milionów dolarów w dowolnych kolejnych dwunastu miesiącach, musi uzyskać od Qwen odrębną licencję przed komercyjnym użyciem. Analogicznie moonshotai/Kimi-K3 ma licencję Kimi K3 License z progiem 20 milionów dolarów łącznego przychodu w dowolnych kolejnych dwunastu miesiącach dla działalności Model as a Service oraz z tym samym obowiązkiem wyświetlania nazwy powyżej 100 milionów użytkowników miesięcznie lub 20 milionów dolarów przychodu miesięcznie.
Obie licencje wyłączają z tych wymogów użycie wewnętrzne, czyli takie, które nie udostępnia modelu, jego wyników ani jego możliwości podmiotom trzecim. Jeśli natomiast budujesz na Together własne API dla klientów, to jesteś dokładnie tym adresatem, o którym mówi punkt o Model as a Service. Więcej kontekstu o rodzinach modeli znajdziesz w tekstach o Qwenie, Llamie od Meta i Hugging Face, gdzie leżą same wagi. Wybór pozycji z listy modeli jest zawsze także wyborem licencji.
Pierwsze wywołanie i zgodność z OpenAI
Bazowy adres to https://api.together.ai/v1. Klient czyta zmienne TOGETHER_API_KEY, TOGETHER_BASE_URL, TOGETHER_PROJECT_ID i TOGETHER_CUSTOM_HEADERS; wersja TypeScript dokłada TOGETHER_LOG. Warstwa zgodności pozwala podłączyć istniejący kod napisany pod klienta OpenAI przez podmianę klucza i adresu.
import Together from 'together-ai'
const client = new Together({
apiKey: process.env.TOGETHER_API_KEY,
})
const completion = await client.chat.completions.create({
model: 'openai/gpt-oss-120b',
messages: [{ role: 'user', content: 'Podaj trzy zalety FP4.' }],
max_tokens: 512,
reasoning_effort: 'low',
})
console.log(completion.choices[0]?.message?.content)Zgodność nie jest pełna i dokumentacja wylicza wyjątki. Niewspierane są assistants, threads i runs, batches w kształcie OpenAI, fine_tuning.jobs w kształcie OpenAI oraz moderations.create. Zasoby files działają częściowo, bo Together ma własne API plików dla zbiorów treningowych i zadań wsadowych. Parametr logit_bias nie działa na większości modeli. Parametry service_tier, store, metadata i prediction są przyjmowane i ignorowane, podobnie jak pole detail przy obrazach.
Najbardziej kosztowna różnica dotyczy kształtu pola usage i potrafi po cichu zerować metryki. Modele rozumujące, na przykład zai-org/GLM-5.2 czy Qwen/Qwen3.6-Plus, zagnieżdżają liczniki po nowemu: tokeny z pamięci podręcznej w usage.prompt_tokens_details.cached_tokens, tokeny rozumowania w usage.completion_tokens_details.reasoning_tokens. Część modeli nierozumujących, w tym meta-llama/Llama-3.3-70B-Instruct-Turbo, zwraca cached_tokens płasko na najwyższym poziomie usage, bez obiektów *_details. Klient przygotowany tylko na jeden kształt zwróci zero, bez żadnego błędu. Łańcuch myśli wraca w polu reasoning na wiadomości asystenta, a starszy klucz reasoning_content jest nadal przyjmowany na wejściu.
Cennik policzony na konkretnych liczbach
Stawki serwerless za milion tokenów, ze strony cennika dostawcy z 22 sierpnia 2026 roku:
| Model | Wejście | Wejście z pamięci podręcznej | Wyjście |
|---|---|---|---|
| openai/gpt-oss-120b | 0,15 USD | brak stawki | 0,60 USD |
| meta-llama/Llama-3.3-70B-Instruct-Turbo | 1,04 USD | brak stawki | 1,04 USD |
| Qwen/Qwen3.5-397B-A17B | 0,60 USD | 0,35 USD | 3,60 USD |
| moonshotai/Kimi-K3 | 3,00 USD | 0,30 USD | 15,00 USD |
| deepseek-ai/DeepSeek-V4-Flash-0731 | 0,14 USD | 0,03 USD | 0,28 USD |
Najbardziej użyteczne porównanie to ten sam model u innych dostawców. Dla openai/gpt-oss-120b interfejs OpenRoutera wylicza dwadzieścia punktów końcowych. Together figuruje tam ze stawką 0,15 USD za wejście i 0,60 USD za wyjście, czyli dokładnie tak jak we własnym cenniku. Groq ma identyczne 0,15 i 0,60. Najtańszy punkt na tej liście to CoreWeave z 0,03 USD za wejście i 0,17 USD za wyjście przy kwantyzacji FP4, a DeepInfra ma 0,037 i 0,17 przy BF16. Dla obciążenia zdominowanego przez wyjście różnica między Together a najtańszą pozycją to około trzy i pół raza. Zastrzeżenie jest istotne: dostawcy różnią się kwantyzacją, długością kontekstu i realną przepustowością, więc niższa stawka nie zawsze oznacza ten sam wynik jakościowy.
Ceny API wsadowego wyglądają na stronie cennika identycznie jak serwerless dla modeli wypisanych w obu tabelach. MiniMax M3 to 0,30 i 1,20 USD w obu, Kimi K3 to 3,00 i 15,00 USD w obu, Gemma 4 31B to 0,39 i 0,97 USD w obu. Dokumentacja limitów pisze przy tym o zniżkach na większości modeli w trybie wsadowym. To rozbieżność między dwiema powierzchniami dostawcy i przy planowaniu budżetu bezpieczniej przyjąć stawki z tabeli, a zniżkę potraktować jako niepotwierdzoną.
Dedykowane endpointy i klastry GPU rozliczane są za godzinę na GPU i tu arytmetyka bywa zaskakująca. Dedykowany endpoint na NVIDIA HGX H100 kosztuje 5,49 USD za godzinę na GPU, na HGX B200 8,99 USD; pozostały sprzęt jest opisany jako kontakt z dostawcą. Klaster GPU z tym samym H100 kosztuje 3,99 USD za godzinę na GPU na żądanie, czyli endpoint jest o niecałe 38 procent droższy od surowej maszyny za tę samą kartę. Rezerwacja klastra obniża stawkę stopniowo: 3,69 USD przy 7 do 30 dni, 3,45 USD przy 31 do 90 dni, 3,19 USD przy 91 do 180 dni, a powyżej 180 dni cennik odsyła do kontaktu. Miesiąc pracy jednego H100 w dedykowanym endpoincie to przy trzydziestu dobach 3952,80 USD. Za tę samą kwotę na Llamie 3.3 70B w serwerless kupisz około 3,8 miliarda tokenów, licząc po jednakowej stawce 1,04 USD za milion w obie strony. Dopóki nie przerabiasz miliardów tokenów miesięcznie na jednym modelu, dedykowany sprzęt się nie zwraca.
endpoint = client.endpoints.create(
model="meta-llama/Llama-3.3-70B-Instruct-Turbo",
hardware="2x_nvidia_h100_80gb_sxm",
autoscaling={"min_replicas": 1, "max_replicas": 3},
display_name="llama-33-prod",
inactive_timeout=30,
disable_speculative_decoding=False,
state="STARTED",
)
print(endpoint.id, endpoint.state)Identyfikator sprzętu bierz z client.endpoints.list_hardware(), które zwraca pole id oraz pricing.cents_per_minute i specs.gpu_count; użyty wyżej 2x_nvidia_h100_80gb_sxm pochodzi z przykładów wbudowanych w CLI paczki i oznacza dwie karty, czyli podwójną stawkę godzinową. Pole min_replicas ustawione na 1 oznacza, że płacisz także w nocy. Ustawienie inactive_timeout na liczbę minut wyłącza endpoint po okresie bezczynności, a wartość zero, null albo pominięcie pola wyłączają samo wyłączanie. Pole disable_prompt_cache nadal istnieje w schemacie, ale dokumentacja opisuje je jako przestarzałe i pozbawione efektu.
Dostrajanie rozliczane jest za sumę tokenów zbioru treningowego pomnożonego przez liczbę epok plus tokeny zbioru walidacyjnego pomnożone przez liczbę ewaluacji, z minimalną opłatą 4,00 USD za zadanie. Dla modeli do 16 miliardów parametrów stawki zaczynają się od 0,48 USD za milion tokenów przy uczeniu nadzorowanym i 1,20 USD przy optymalizacji preferencji. Cennik pokazuje pod tymi dwoma nagłówkami po dwie kolumny liczb, ale podpisy podkolumn nie renderują się bez JavaScriptu, więc nie przypisuję ich ani do LoRA, ani do pełnego dostrajania. Dla modeli wypisanych z nazwy stawki są wyższe: gpt-oss-120B to 5,00 USD przy uczeniu nadzorowanym z LoRA i 12,50 USD przy optymalizacji preferencji, z minimalną opłatą 6,00 USD za zadanie.
job = client.fine_tuning.create(
training_file="file-abc123",
model="openai/gpt-oss-120b",
n_epochs=3,
validation_file="file-def456",
n_evals=3,
learning_rate=1e-5,
lr_scheduler_type="cosine",
warmup_ratio=0.05,
batch_size="max",
lora=True,
lora_r=16,
lora_alpha=32,
lora_trainable_modules="all-linear",
training_method="sft",
suffix="support-bot",
early_stopping_enabled=True,
early_stopping_patience=2,
)Jeden szczegół z rozpakowanej paczki: w wersji synchronicznej metody create parametr lora ma domyślnie wartość None, a w wersji asynchronicznej True. Ustawiaj go jawnie, zamiast liczyć na domyślną.
Limity zapytań i rozliczenie z góry
Together stosuje limity dynamiczne, ustalane osobno dla organizacji i dla modelu. Dawne etykiety poziomów konta, czyli Build Tier od 1 do 5 oraz Scale i Enterprise, zostały wycofane i nie pojawiają się już ani w koncie, ani w odpowiedziach API. Limit rośnie wraz z utrzymanym, udanym ruchem, a nagłe skoki daleko powyżej dotychczasowego użycia są przycinane. Odpowiedź 429 przychodzi z typem błędu dynamic_request_limited albo dynamic_token_limited i z nagłówkiem x-ratelimit-reset podającym sugerowaną przerwę w sekundach. Osobna sytuacja to 503, zwracane, gdy żądanie mieściło się w limicie, ale model był przeciążony.
Tu jest rozbieżność wewnątrz samej dokumentacji. Strona o limitach serwerless pisze, że udane żądania wracają bez nagłówków limitowych i że nagłówek x-ratelimit-reset pojawia się dopiero przy 429. Strona o limitach użycia w sekcji rozliczeń pisze, że każde żądanie do wnioskowania serwerless zwraca nagłówki z aktualnymi limitami, użyciem i czasem zerowania. Obie wersje pochodzą od dostawcy i się wykluczają, więc kod trzeba napisać tak, by radził sobie z brakiem nagłówka.
response = client.chat.completions.with_raw_response.create(
model="meta-llama/Llama-3.3-70B-Instruct-Turbo",
messages=[{"role": "user", "content": "ping"}],
)
reset = response.http_response.headers.get("x-ratelimit-reset")
if reset is None:
print("status:", response.http_response.status_code, "(bez limitu)")
else:
print("limit osiagniety, ponow za", reset, "sekund")Planu darmowego nie ma. Dokumentacja stwierdza wprost, że Together nie oferuje obecnie okresów próbnych, a dostęp do platformy wymaga zakupu kredytów za minimum 5 dolarów. Rozliczenie jest w całości przedpłacone: przy saldzie zerowym dostęp do API zostaje zawieszony do czasu doładowania. Kredyty nie mają daty ważności, ale te kupione po wystawieniu faktury nie mogą zostać użyte do rozliczenia wcześniejszych zaległości. Automatyczne doładowanie działa wyłącznie wtedy, gdy domyślną metodą płatności jest karta; ustawienie przelewu bankowego jako domyślnego wyłącza je samoczynnie.
Together obok Groq, OpenRouter, Replicate i vLLM
| Cecha | Together AI | Groq | OpenRouter | Replicate | vLLM |
|---|---|---|---|---|---|
| Rozliczenie | za token oraz za godziny GPU | za token | za token plus prowizja przy doładowaniu | za token albo za czas pracy sprzętu | koszt własnego sprzętu |
| Sprzęt | GPU NVIDIA u dostawcy | własne układy dostawcy | sprzęt dostawcy, do którego trafi żądanie | GPU u dostawcy | Twój |
| Wybór modelu | katalog Together | katalog Groq | wielu dostawców naraz | katalog i obrazy użytkowników | dowolne wagi, które pobierzesz |
| Poza wnioskowaniem | dostrajanie, klastry GPU | wnioskowanie | trasowanie i rozliczenie | uruchamianie własnych obrazów | silnik serwujący |
| Wariant u siebie | brak | brak | brak | brak | jedyny wariant |
| Licencja modelu | po Twojej stronie | po Twojej stronie | po Twojej stronie | po Twojej stronie | po Twojej stronie |
Together siedzi pomiędzy dwiema skrajnościami. Z jednej strony jest vLLM, czyli uruchomienie wag na własnym sprzęcie, z pełną kontrolą i pełnym kosztem utrzymania. Z drugiej OpenRouter, który sam nic nie serwuje, tylko trasuje żądania do dostawców i pobiera prowizję przy doładowaniu konta. Together serwuje samodzielnie, więc odpada warstwa pośrednika, ale za to katalog jest jeden i zamknięty. Wobec Groq różnica leży w sprzęcie i w zakresie: Groq stawia na szybkość na własnych układach, Together dokłada dostrajanie i wynajem klastrów. Wobec Replicate różnica leży w tym, co można wgrać: Replicate pozwala uruchomić własny obraz, Together ogranicza się do swojego katalogu i modeli dostrojonych u siebie.
Sensowny wybór wygląda tak. Bierz Together, gdy chcesz jednego dostawcę na wnioskowanie i dostrajanie, akceptujesz stawki wyższe od najtańszych i cenisz to, że dostrojony model da się od razu postawić na dedykowanym endpoincie. Nie bierz, gdy liczysz każdy grosz przy dużym wolumenie, gdy potrzebujesz wariantu u siebie ze względu na dane, albo gdy Twój model jest w katalogu jedną pozycją, której zniknięcie zatrzyma produkt.
Typowe błędy
Pomylenie nazwy pakietu. pip install together-ai nie zadziała, a npm install together zainstaluje bibliotekę do HTML z 2014 roku. Kierunek jest odwrotny w każdym z dwóch ekosystemów.
Wskazywanie togethercomputer/together-python jako repozytorium klienta. To repozytorium linii 1.x, zamrożonej na v1.5.35 z 21 stycznia 2026 roku. Kod wersji 2.31.0 leży w togethercomputer/together-py.
Założenie, że Apache 2.0 na kliencie przykrywa model. Nie przykrywa. Qwen3.8-Max License i Kimi K3 License mają progi przychodowe, licencja Llamy 3.3 ma własne warunki, a Together nie pokazuje licencji w tabeli katalogu.
Odczyt tokenów z pamięci podręcznej z jednego miejsca. Modele rozumujące zwracają je w usage.prompt_tokens_details.cached_tokens, część pozostałych płasko w usage.cached_tokens. Czytaj oba miejsca, bo brak wartości nie generuje błędu.
Uruchomienie dedykowanego endpointu na próbę i zostawienie go. Przy min_replicas równym 1 i braku inactive_timeout H100 nabija 5,49 USD za godzinę bez przerwy, czyli blisko 132 USD na dobę.
Planowanie budżetu na podstawie zniżki wsadowej. Tabela cennika pokazuje dla wypisanych modeli te same stawki co serwerless, mimo że dokumentacja mówi o zniżkach.
Liczenie na stały limit zapytań. Limity są dynamiczne i rosną razem z ruchem; jeśli potrzebujesz znanej z góry wartości, dokumentacja kieruje do wnioskowania dedykowanego.
FAQ
Czy Together AI ma plan darmowy?
Nie. Dokumentacja rozliczeń stwierdza, że okresów próbnych obecnie nie ma, a dostęp do platformy wymaga zakupu kredytów za minimum 5 dolarów. Konto jest w całości przedpłacone i przy saldzie zerowym API zostaje zawieszone.
Czy mogę użyć klienta OpenAI zamiast SDK Together?
Tak, przez podmianę klucza i ustawienie base_url na https://api.together.ai/v1. Poza zasięgiem tej warstwy zostają assistants, threads, runs, batches i fine_tuning.jobs w kształcie OpenAI oraz moderations.create, a files działa częściowo.
Czy korzystanie z modelu przez API zwalnia mnie z jego licencji?
Nie. Licencja wag obowiązuje niezależnie od tego, kto uruchamia serwer. Przy Qwen/Qwen3.8-2.4T-A95B odrębna umowa z Qwen jest wymagana, gdy prowadzisz działalność typu Model as a Service, a łączny przychód przekracza 50 milionów dolarów w kolejnych dwunastu miesiącach; przy moonshotai/Kimi-K3 analogiczny próg wynosi 20 milionów dolarów.
Jak sprawdzić licencję modelu przed wdrożeniem?
Endpoint GET /v1/models zwraca opcjonalne pole license obok organization i link. Tabela katalogu w dokumentacji nie ma kolumny z licencją, więc pewniejszym źródłem jest karta modelu u autora wag.
Kiedy dedykowany endpoint jest tańszy od serwerless?
Godzina H100 kosztuje 5,49 USD za GPU, czyli 3952,80 USD za trzydzieści dób ciągłej pracy. Na Llamie 3.3 70B po 1,04 USD za milion tokenów w obie strony ta sama kwota kupuje w serwerless około 3,8 miliarda tokenów. Poniżej tego wolumenu na jednym modelu dedykowany sprzęt się nie zwraca.
Czy limity zapytań zależą od poziomu konta?
Nie w dawnym rozumieniu. Etykiety Build Tier od 1 do 5 oraz Scale i Enterprise zostały wycofane. Limity są dynamiczne, ustalane per organizacja i per model, i rosną wraz z utrzymanym udanym ruchem.