Twój JSONL wchodzi. Wychodzi dostrojony GGUF.
Wgrywasz plik z przykładami rozmów. Dostrajamy otwarty model na RTX 4090 i odsyłamy GGUF, które działają w Ollamie, LM Studio albo llama.cpp. Od 5 USD.
Zobacz prawdziwy raport, ze 120-liniowego zbioru testowego na Qwen3 8B.
| Plik | Rozmiar | Otwiera się w |
|---|---|---|
| qwen3-8b-q4_k_m.gguf | ok. 5 GB | Ollama, llama.cpp, LM Studio |
| qwen3-8b-q8_0.gguf | ok. 9 GB | to samo, wyższa precyzja |
| Modelfile | tekst | ollama create |
| adapter.zip | 40 do 200 MB | adapter LoRA, do własnego scalenia |
| report.html | tekst | Twoja przeglądarka |
| metrics.json | tekst | raport jako JSON |
| Zwykle tego samego dnia | od 5 USD | e-mail + panel |
Co dostajesz
Sześć plików w panelu i jeden e-mail. Dataset i pliki kasujemy 14 dni po dostawie.
| Plik | Co to jest |
|---|---|
<model>-<job>-q4_k_m.gguf | Dostrojony model, 4-bit. Ok. 5 GB dla modelu 8B. Otwiera się w Ollamie, llama.cpp albo LM Studio. |
<model>-<job>-q8_0.gguf | Ten sam model, 8-bit. Ok. 9 GB dla 8B. Bliżej pełnej precyzji. |
Modelfile | Wskazuje Ollamie GGUF i niesie Twój prompt systemowy. ollama create moj -f Modelfile, potem ollama run moj. |
adapter.zip | Adapter LoRA, 40 do 200 MB, jeśli chcesz sam scalić go z wagami bazowymi. |
report.html | Strata walidacyjna przed i po, krzywa straty oraz do 20 pytań ze zbioru testowego z odpowiedziami modelu bazowego i Twojego, obok siebie. |
metrics.json | Te same liczby, jako JSON. |
Jak to działa
Wgrywasz plik, wybierasz model i płacisz. Hiperparametrów nie ustawiasz.
Wgrywasz JSONL
Do 200 MB, jeden obiekt JSON na linię. Przeglądarka liczy tokeny, wskazuje pakiet i sprawdza każdą linię zanim cokolwiek wyśle, zgłaszając do 10 błędnych linii z numerem.
Wybierasz model i 1 do 3 epok
Tabela modeli pokazuje, co jest dostępne dzisiaj. Długość sekwencji to 2048, albo 1024 dla Qwen3 32B.
Płacisz kartą
Strona płatności Stripe. Przycisk podaje pakiet i cenę w USD, z VAT, i dostajesz fakturę. Cena jest ustalona przed płatnością.
GPU sprawdza plik jeszcze raz
Jeśli linia nie przejdzie, strona joba pozwala poprawić plik i wgrać go jeszcze raz, jeden raz, za darmo, w tym samym pakiecie. Większy pakiet wymaga nowego joba.
Trening idzie na RTX 4090
Panel pokazuje fazę, numer kroku, stratę i czas ostatniej aktualizacji, odświeżane co 30 sekund. 5% przykładów, maks. 500, odkładamy do walidacji.
Pliki mailem i w panelu
Większość jobów wraca tego samego dnia. Pakiet S to kilka godzin, M około doby, L dwa do trzech dni. Linki do pobrania wymagają zalogowania, a dataset i pliki kasujemy 14 dni po dostawie.
Modele
Otwarte modele od 8B do 32B. Qwen3 8B jest domyślny, Bielik to wybór dla polskiego, Qwen3 32B to wariant large. Model wstrzymany dzisiaj ma to napisane w ostatniej kolumnie.
| Model | Parametry | Języki | Licencja | Cena | Uwagi |
|---|---|---|---|---|---|
| Qwen3 8B | 8.2 B | angielski, polski, wielojęzyczny | Apache 2.0 | baza | Default pick. Strong general model, 119 languages. |
| Qwen3 14B | 14.8 B | angielski, polski, wielojęzyczny | Apache 2.0 | baza | Better quality than 8B, fits 4090 in 4-bit at seq 2048. |
| Bielik 11B v3 Instruct | 11 B | polski | Apache 2.0 | baza | Best open Polish model (SpeakLeash). |
| Llama 3.1 8B Instruct | 8 B | angielski, wielojęzyczny | Llama 3.1 Community License | baza | Derivatives must carry 'Built with Llama'. Wymaga akceptacji licencji na Hugging Face. |
| Mistral Nemo 12B Instruct | 12.2 B | angielski, wielojęzyczny | Apache 2.0 | baza | 128k context, good for long documents. Wymaga akceptacji licencji na Hugging Face. |
| Gemma 3 12B IT | 12.2 B | angielski, wielojęzyczny | Gemma Terms of Use | baza | Text only in our pipeline. Wymaga akceptacji licencji na Hugging Face. |
| Qwen3 32B | 32.8 B | angielski, polski, wielojęzyczny | Apache 2.0 | x2.5 | Large tier, x2.5 price. Runs on 4090 in 4-bit at seq 1024. |
Cennik
Tokeny treningowe to tokeny w Twoim datasecie razy liczba epok, 1 do 3. Trzy pakiety.
| Pakiet | Tokeny treningowe | Czas realizacji | Cena |
|---|---|---|---|
| Pakiet S | do 20M | kilka godzin | $5 |
| Pakiet M | do 100M | około doby | $13 |
| Pakiet L | do 500M | 2 do 3 dni | $39 |
Qwen3 32B mnoży cenę przez 2,5. Secure cloud, czyli GPU w centrum danych zamiast hostów społecznościowych, dodaje 50%. Keep the GPU in the EU to opcja Secure w tej samej cenie, a pliki trzymamy w UE.
Pytania, które dostajemy
Co ma zawierać JSONL?
Jeden obiekt JSON na linię, do 200 MB. Użyj {"messages":[...]}, {"prompt","completion"} albo {"instruction","input","output"}. Przeglądarka sprawdza każdą linię przed wgraniem i zgłasza do 10 błędnych z numerem.
Co, jeśli GPU odrzuci plik?
Strona joba podaje numer linii. Popraw plik i wgraj go jeszcze raz, jeden raz, za darmo, w tym samym pakiecie. Jeśli poprawiony plik potrzebuje większego pakietu, załóż nowy job.
Wybieram hiperparametry?
Nie, każdy job to QLoRA z rank 16, alpha 32, dropout 0, learning rate 0,0002, batch 8, warmup 3% i checkpoint co 200 kroków. Długość sekwencji to 2048, albo 1024 dla Qwen3 32B. 5% przykładów, maks. 500, odkładamy do walidacji.
Co, jeśli dataset potrzebuje więcej tokenów, niż pokrywa pakiet?
Szacunek wskazuje pakiet przed płatnością i ta cena jest ustalona. Powyżej pakietu L, 500M tokenów treningowych, formularz nie weźmie płatności. Jeśli GPU naliczy więcej tokenów, niż pokrywa pakiet, job staje z obiema liczbami, a Ty wgrywasz krótszy plik, raz, za darmo.
Gdzie idzie trening i kto widzi moje dane?
Pliki leżą na Cloudflare R2 z jurysdykcją UE. GPU Community to hosty społecznościowe RunPod, więc bez danych osobowych. Secure to GPU w centrum danych w UE albo w USA, +50%, z umową powierzenia w regulaminie, a Keep the GPU in the EU kosztuje tyle samo.
Co, jeśli nie znajdzie się GPU?
Jeśli w ciągu 24 godzin od płatności nie znajdziemy GPU, job kończy się niepowodzeniem i dostajesz e-mail. Zwrot płacimy na życzenie.
Jak uruchomić wynik?
W Ollamie nic nie rozpakowujesz: ollama create moj -f Modelfile, potem ollama run moj. llama.cpp i LM Studio otwierają GGUF bezpośrednio. Adapter jest, jeśli wolisz scalić sam.
Jakie kwantyzacje dostaję?
q4_k_m i q8_0, oba w każdym jobie, plus nieskwantyzowany adapter LoRA.
Mogę puścić ten sam dataset jeszcze raz z innym modelem albo więcej epok?
Tak. Nowy job, cena z cennika. Nie ma zniżki za drugi raz.
Jak się loguję?
Linkiem wysłanym na e-mail. Nie ma hasła. Linki do pobrania działają tylko po zalogowaniu.