fine-tuning dostarczany jako pliki

Twój JSONL wchodzi. Wychodzi dostrojony GGUF.

Wgrywasz plik z przykładami rozmów. Dostrajamy otwarty model na RTX 4090 i odsyłamy GGUF, które działają w Ollamie, LM Studio albo llama.cpp. Od 5 USD.

Zobacz prawdziwy raport, ze 120-liniowego zbioru testowego na Qwen3 8B.

Co przychodzi, dla Qwen3 8B
PlikRozmiarOtwiera się w
qwen3-8b-q4_k_m.ggufok. 5 GBOllama, llama.cpp, LM Studio
qwen3-8b-q8_0.ggufok. 9 GBto samo, wyższa precyzja
Modelfiletekstollama create
adapter.zip40 do 200 MBadapter LoRA, do własnego scalenia
report.htmltekstTwoja przeglądarka
metrics.jsontekstraport jako JSON
Zwykle tego samego dniaod 5 USDe-mail + panel

Co dostajesz

Sześć plików w panelu i jeden e-mail. Dataset i pliki kasujemy 14 dni po dostawie.

Otwórz prawdziwy report.html

PlikCo to jest
<model>-<job>-q4_k_m.ggufDostrojony model, 4-bit. Ok. 5 GB dla modelu 8B. Otwiera się w Ollamie, llama.cpp albo LM Studio.
<model>-<job>-q8_0.ggufTen sam model, 8-bit. Ok. 9 GB dla 8B. Bliżej pełnej precyzji.
ModelfileWskazuje Ollamie GGUF i niesie Twój prompt systemowy. ollama create moj -f Modelfile, potem ollama run moj.
adapter.zipAdapter LoRA, 40 do 200 MB, jeśli chcesz sam scalić go z wagami bazowymi.
report.htmlStrata walidacyjna przed i po, krzywa straty oraz do 20 pytań ze zbioru testowego z odpowiedziami modelu bazowego i Twojego, obok siebie.
metrics.jsonTe same liczby, jako JSON.

Jak to działa

Wgrywasz plik, wybierasz model i płacisz. Hiperparametrów nie ustawiasz.

  1. Wgrywasz JSONL

    Do 200 MB, jeden obiekt JSON na linię. Przeglądarka liczy tokeny, wskazuje pakiet i sprawdza każdą linię zanim cokolwiek wyśle, zgłaszając do 10 błędnych linii z numerem.

  2. Wybierasz model i 1 do 3 epok

    Tabela modeli pokazuje, co jest dostępne dzisiaj. Długość sekwencji to 2048, albo 1024 dla Qwen3 32B.

  3. Płacisz kartą

    Strona płatności Stripe. Przycisk podaje pakiet i cenę w USD, z VAT, i dostajesz fakturę. Cena jest ustalona przed płatnością.

  4. GPU sprawdza plik jeszcze raz

    Jeśli linia nie przejdzie, strona joba pozwala poprawić plik i wgrać go jeszcze raz, jeden raz, za darmo, w tym samym pakiecie. Większy pakiet wymaga nowego joba.

  5. Trening idzie na RTX 4090

    Panel pokazuje fazę, numer kroku, stratę i czas ostatniej aktualizacji, odświeżane co 30 sekund. 5% przykładów, maks. 500, odkładamy do walidacji.

  6. Pliki mailem i w panelu

    Większość jobów wraca tego samego dnia. Pakiet S to kilka godzin, M około doby, L dwa do trzech dni. Linki do pobrania wymagają zalogowania, a dataset i pliki kasujemy 14 dni po dostawie.

Modele

Otwarte modele od 8B do 32B. Qwen3 8B jest domyślny, Bielik to wybór dla polskiego, Qwen3 32B to wariant large. Model wstrzymany dzisiaj ma to napisane w ostatniej kolumnie.

ModelParametryJęzykiLicencjaCenaUwagi
Qwen3 8B
Qwen/Qwen3-8B
8.2 Bangielski, polski, wielojęzycznyApache 2.0bazaDefault pick. Strong general model, 119 languages.
Qwen3 14B
Qwen/Qwen3-14B
14.8 Bangielski, polski, wielojęzycznyApache 2.0bazaBetter quality than 8B, fits 4090 in 4-bit at seq 2048.
Bielik 11B v3 Instruct
speakleash/Bielik-11B-v3.0-Instruct
11 BpolskiApache 2.0bazaBest open Polish model (SpeakLeash).
Llama 3.1 8B Instruct
meta-llama/Llama-3.1-8B-Instruct
8 Bangielski, wielojęzycznyLlama 3.1 Community LicensebazaDerivatives must carry 'Built with Llama'. Wymaga akceptacji licencji na Hugging Face.
Mistral Nemo 12B Instruct
mistralai/Mistral-Nemo-Instruct-2407
12.2 Bangielski, wielojęzycznyApache 2.0baza128k context, good for long documents. Wymaga akceptacji licencji na Hugging Face.
Gemma 3 12B IT
google/gemma-3-12b-it
12.2 Bangielski, wielojęzycznyGemma Terms of UsebazaText only in our pipeline. Wymaga akceptacji licencji na Hugging Face.
Qwen3 32B
Qwen/Qwen3-32B
32.8 Bangielski, polski, wielojęzycznyApache 2.0x2.5Large tier, x2.5 price. Runs on 4090 in 4-bit at seq 1024.

Cennik

Tokeny treningowe to tokeny w Twoim datasecie razy liczba epok, 1 do 3. Trzy pakiety.

Jedna cena za pakiet. Kalkulator poniżej wskazuje Twój, zanim zapłacisz.
PakietTokeny treningoweCzas realizacjiCena
Pakiet Sdo 20Mkilka godzin$5
Pakiet Mdo 100Mokoło doby$13
Pakiet Ldo 500M2 do 3 dni$39

Qwen3 32B mnoży cenę przez 2,5. Secure cloud, czyli GPU w centrum danych zamiast hostów społecznościowych, dodaje 50%. Keep the GPU in the EU to opcja Secure w tej samej cenie, a pliki trzymamy w UE.

Oszacuj pakiet

Wybierz plik albo upuść go tutajZostaje w przeglądarce. Do 200 MB.
Jeden przykład na linię, jak w pliku.
Epoki
Tokeny treningowe = tokeny datasetu x epoki.
Przykład; zastąpią go Twoje liczby, gdy wybierzesz plik albo wkleisz próbkę
Plik 12,4 MB to ok. 3,4M tokenów datasetu. Przy 2 epokach to 6,9M tokenów treningowych.
Pakiet S, 5 USD
Szacunek z rozmiaru (bajty / 3,6). Dokładne liczenie robi panel po wgraniu, przed płatnością.

Pytania, które dostajemy

Co ma zawierać JSONL?

Jeden obiekt JSON na linię, do 200 MB. Użyj {"messages":[...]}, {"prompt","completion"} albo {"instruction","input","output"}. Przeglądarka sprawdza każdą linię przed wgraniem i zgłasza do 10 błędnych z numerem.

Co, jeśli GPU odrzuci plik?

Strona joba podaje numer linii. Popraw plik i wgraj go jeszcze raz, jeden raz, za darmo, w tym samym pakiecie. Jeśli poprawiony plik potrzebuje większego pakietu, załóż nowy job.

Wybieram hiperparametry?

Nie, każdy job to QLoRA z rank 16, alpha 32, dropout 0, learning rate 0,0002, batch 8, warmup 3% i checkpoint co 200 kroków. Długość sekwencji to 2048, albo 1024 dla Qwen3 32B. 5% przykładów, maks. 500, odkładamy do walidacji.

Co, jeśli dataset potrzebuje więcej tokenów, niż pokrywa pakiet?

Szacunek wskazuje pakiet przed płatnością i ta cena jest ustalona. Powyżej pakietu L, 500M tokenów treningowych, formularz nie weźmie płatności. Jeśli GPU naliczy więcej tokenów, niż pokrywa pakiet, job staje z obiema liczbami, a Ty wgrywasz krótszy plik, raz, za darmo.

Gdzie idzie trening i kto widzi moje dane?

Pliki leżą na Cloudflare R2 z jurysdykcją UE. GPU Community to hosty społecznościowe RunPod, więc bez danych osobowych. Secure to GPU w centrum danych w UE albo w USA, +50%, z umową powierzenia w regulaminie, a Keep the GPU in the EU kosztuje tyle samo.

Co, jeśli nie znajdzie się GPU?

Jeśli w ciągu 24 godzin od płatności nie znajdziemy GPU, job kończy się niepowodzeniem i dostajesz e-mail. Zwrot płacimy na życzenie.

Jak uruchomić wynik?

W Ollamie nic nie rozpakowujesz: ollama create moj -f Modelfile, potem ollama run moj. llama.cpp i LM Studio otwierają GGUF bezpośrednio. Adapter jest, jeśli wolisz scalić sam.

Jakie kwantyzacje dostaję?

q4_k_m i q8_0, oba w każdym jobie, plus nieskwantyzowany adapter LoRA.

Mogę puścić ten sam dataset jeszcze raz z innym modelem albo więcej epok?

Tak. Nowy job, cena z cennika. Nie ma zniżki za drugi raz.

Jak się loguję?

Linkiem wysłanym na e-mail. Nie ma hasła. Linki do pobrania działają tylko po zalogowaniu.