// SPIS TREŚCI
- Co to jest Qwen-Image-2.1 i co robi „viggle turbo”
- Dlaczego 4 kroki zamiast 40 to nie tylko szybkość
- Na jakim sprzęcie to chodzi — relacja z pola
- Licencja: to jest miejsce, w którym ludzie się potykają
- Do czego w reklamie: packshoty, warianty, przezroczyste PNG
- Lokalnie czy API — rachunek dla małego sklepu
- Plan testu w tym notatniku
- FAQ
Co to jest Qwen-Image-2.1 i co robi „viggle turbo”
Dwa linki z WhatsAppa tego samego ranka: o 7:37 OpenAI z cenami (opisałem to we wpisie #052), a chwilę później wpis konta AI Search: „Qwen Image 2.1 viggle turbo. This generates images in only 4 steps instead of 40, making it way faster”. Krótko, bez fajerwerków — i właśnie dlatego kliknąłem.
Qwen-Image-2.1 to model Alibaby do generowania obrazów z tekstu i edycji obrazów na podstawie jednego do trzech obrazów referencyjnych. Według GIGAZINE został wydany 20.09.2026, ma 7 miliardów parametrów (mniej niż poprzednik Qwen-Image-2512 ze stycznia), rozumie prompty po angielsku i japońsku, potrafi generować przezroczyste PNG i edytować istniejące zdjęcia.
Viggle turbo to nie nowy model, tylko adapter LoRA (ranga 256) nakładany na bazowy transformator. Wytrenowany metodą Distribution Matching Distillation z podejściem SenseFlow, pozwala generować obraz w 6 krokach (wersja v0.2.1) lub 4 krokach (starsza v0.1) zamiast 40. Karta modelu podaje uczciwe porównanie z bazą na 96 zapytaniach użytkowników: różnorodność 0,98× bazy, zerowy dryf kompozycji — ale wciąż „trudności ze złożonymi edycjami”.
Dlaczego 4 kroki zamiast 40 to nie tylko szybkość
Modele dyfuzyjne budują obraz iteracyjnie: każdy krok to jedno przejście przez sieć. 40 kroków to 40 przejść. Destylacja uczy model „skakać” — dochodzić do podobnego wyniku w kilku przejściach. Efekt to nie tylko krótszy czas:
- Tańszy sprzęt. Skoro potrzeba 10× mniej obliczeń, ten sam obraz powstaje na karcie, która przy 40 krokach byłaby bezużyteczna.
- Iteracja w pętli. Przy 3 minutach na obraz robisz 20 prób dziennie. Przy 20 sekundach — 200. To zmienia sposób pracy nad kreacją: z „zamawiania” na „szkicowanie”.
- Warianty do testów. Dziesięć wersji tego samego packshotu w różnych tłach to w reklamie Meta dziesięć kreacji do testu, nie dziesięć zleceń dla grafika.
Cena, jaką się za to płaci, to zwykle różnorodność i precyzja w trudnych edycjach — karta modelu mówi o tym wprost. Dla packshotu na jednolitym tle to zwykle nie ma znaczenia; dla ilustracji z pięcioma postaciami i tekstem — może mieć.
Na jakim sprzęcie to chodzi — relacja z pola
Pod wpisem AI Search użytkownik podpisany jako SapiensIA opisał własny test: skwantyzowana wersja Qwen-Image-2.1 (Unsloth Dynamic 2.0, Q3_K_XL) z nakładką Viggle Turbo i EasyCache na karcie NVIDIA Quadro T1000 z 4 GB — czyli GPU z biurowego laptopa sprzed kilku lat. Szczytowe zużycie pamięci: 1,38 GB. Tempo: 28 sekund na krok, 6 kroków = 2 min 49 s na obraz.
| Źródło | Sprzęt | Czas na obraz 1024×1024 | Uwagi |
|---|---|---|---|
| GIGAZINE (model bazowy) | Intel Arc Pro B70 32 GB + Ryzen 5 7600X | ok. 45 s pierwszy, ok. 30 s kolejne | bez nakładki turbo, pełna precyzja |
| Użytkownik na X (turbo, Q3) | NVIDIA Quadro T1000 4 GB | 2 min 49 s (6 kroków) | 1,38 GB VRAM; sprzęt z dolnej półki |
| Mój test | — | — | jeszcze nie zrobiony, patrz plan |
Dwie relacje, żadna moja. Liczby traktuję jako orientacyjne, dopóki nie zmierzę na własnym komputerze.
Trzy minuty na obraz na 4 GB to nie jest „szybko”. To jest „w ogóle możliwe” — i to jest news. Na karcie z 12–16 GB, których pełno w komputerach do gier, ten sam proces powinien schodzić do sekund. Powinien — sprawdzę.
Licencja: to jest miejsce, w którym ludzie się potykają
Karta modelu Viggle podaje licencję Qwen Research License Agreement: użycie wyłącznie niekomercyjne (badania, ocena); użycie komercyjne wymaga osobnej licencji od Alibaby. GIGAZINE dodaje, że umowa zabrania komercyjnego użycia modelu, ale Alibaba wyjaśniła, iż „prawa do obrazów tworzonych przez użytkowników należą do nich”.
Przeczytaj to dwa razy, bo tu jest pułapka. „Prawa do obrazów należą do użytkownika” to nie to samo co „możesz używać modelu komercyjnie”. Generowanie grafik do reklamy sklepu jest użyciem modelu w celu komercyjnym. Moja interpretacja — a nie jestem prawnikiem i to nie jest porada prawna: do pracy w sklepie potrzebna jest licencja komercyjna albo model z licencją, która ją dopuszcza. Zanim ktoś wrzuci packshot z Qwen do kampanii, powinien przeczytać aktualny tekst licencji, a nie wpis na X ani ten notatnik.
To samo dotyczy kwantyzacji i konwersji publikowanych przez osoby trzecie (GGUF, wersje „comfy”): odziedziczają licencję modelu bazowego. Że plik da się pobrać, nie znaczy, że wolno go użyć w reklamie.
Do czego w reklamie: packshoty, warianty, przezroczyste PNG
- Przezroczyste PNG — model potrafi je generować natywnie. Dla sklepu to koniec ręcznego wycinania tła: produkt na przezroczystym tle wchodzi do każdego szablonu banera.
- Edycja z referencją (1–3 obrazy) — ten sam produkt w innym otoczeniu, na innym stole, w innym świetle. To jest generator wariantów do testów A/B kreacji.
- Tło do rolek — klatki tła do wideo, które potem animujemy (o previzie pisałem w wpisie #045).
- Szkice dla grafika — najmniej efektowne, najbardziej praktyczne: 20 wersji kompozycji w 10 minut, żeby grafik nie zgadywał, co masz w głowie.
Czego bym nie robił: generował zdjęć „prawdziwych klientów”, podrabiał stylu konkretnych ilustratorów, wstawiał wygenerowanych ludzi jako autorów opinii. Nie ze względu na licencję — ze względu na to, że w sklepie sprzedaję zaufanie, a to się nie regeneruje w 6 krokach.
Lokalnie czy API — rachunek dla małego sklepu
| Kryterium | Lokalnie (Qwen + turbo) | API zamkniętego dostawcy |
|---|---|---|
| Koszt jednostkowy | prąd + czas; praktycznie zero po zakupie karty | stała stawka za obraz |
| Koszt wejścia | karta graficzna, konfiguracja, aktualizacje | karta kredytowa |
| Licencja komercyjna | do sprawdzenia — w tym przypadku wymaga osobnej umowy | zwykle w cenie usługi |
| Prywatność danych | produkty nie wychodzą z firmy | zdjęcia idą do dostawcy |
| Jakość szczytowa | zależna od modelu i sprzętu | zwykle wyższa w najtrudniejszych zadaniach |
| Kto naprawia, gdy nie działa | ty | support |
Dla sklepu z tysiącem produktów i stałą potrzebą wariantów kreacji lokalny model jest kuszący. Warunek: karta i licencja, w tej kolejności ważności — odwrotnie niż zwykle ludzie to sprawdzają.
Plan testu w tym notatniku
Model nie jest jeszcze u mnie uruchomiony. Plan:
- Przeczytać pełny tekst Qwen Research License Agreement i zapisać w notatniku, co dokładnie wolno na tej licencji. Bez tego nic dalej nie ma sensu.
- Uruchomić bazowy Qwen-Image-2.1 i wersję z nakładką turbo na moim komputerze. Zmierzyć: czas na obraz 1024×1024, zużycie VRAM, 10 obrazów z tego samego promptu — ocenić powtarzalność.
- Test na zadaniu ze sklepu, ale tylko do oceny wewnętrznej (licencja badawcza): 5 produktów × 4 tła z referencji + przezroczyste PNG. Ślepa ocena przez żonę: nadaje się / nie nadaje.
- Wpis z tabelą czasów i ocen. Jeśli jakość nie wystarcza do packshotu — piszę to i wracam do API.
FAQ
Co to jest Qwen-Image-2.1 viggle turbo?
Adapter LoRA od zespołu Viggle nakładany na otwarty model Qwen-Image-2.1 Alibaby, wytrenowany metodą destylacji (DMD), który pozwala generować obraz w 4–6 krokach zamiast 40 — kilka do kilkunastu razy szybciej na tym samym sprzęcie.
Czy Qwen-Image-2.1 jest darmowy?
Wagi są dostępne bez opłat, ale na licencji badawczej Qwen Research License Agreement, która dopuszcza tylko użycie niekomercyjne. Użycie komercyjne — w tym grafiki do reklam — wymaga osobnej licencji od Alibaby.
Na jakim sprzęcie działa Qwen-Image-2.1 turbo?
Według relacji użytkownika na X, skwantyzowana wersja Q3 z nakładką turbo zajęła 1,38 GB VRAM na karcie NVIDIA Quadro T1000 4 GB i generowała obraz w 2 min 49 s. Na mocniejszych kartach czasy powinny być znacznie krótsze; własnych pomiarów jeszcze nie mam.
Czy mogę użyć obrazów z Qwen-Image w reklamie sklepu?
Prawa do wygenerowanych obrazów należą według Alibaby do użytkownika, ale samo użycie modelu w celu komercyjnym wymaga licencji komercyjnej. Nie jestem prawnikiem — przeczytaj aktualny tekst licencji przed użyciem w kampanii.
Co traci model przy generowaniu w 6 krokach?
Według karty modelu: różnorodność 0,98× bazy, brak dryfu kompozycji, ale wciąż trudności ze złożonymi edycjami. Dla prostych packshotów różnica jest zwykle niewidoczna; dla skomplikowanych scen może być.
Źródła
- Hugging Face, Viggle/Qwen-Image-2.1-viggle-turbo — karta modelu (licencja, kroki, metoda, porównanie z bazą)
- GIGAZINE, I tried out the image generation and editing AI Qwen-Image-2.1 (24.09.2026)
- AI Search na X, wpis z 23.09.2026 oraz odpowiedź użytkownika SapiensIA z wynikami na Quadro T1000
- Hugging Face, wersje GGUF nakładki turbo (publikacje osób trzecich)
Powiązane w notatniku: GPT-6 Sol i Luna — ceny API, previz Blender → Seedance, Fish Audio — głos AI do reklam.
— MK · wróć do notatnika







