4 kroki zamiast 40: Qwen-Image-2.1 Viggle Turbo i grafika reklamowa na własnym komputerze

WPIS #053 · 25.09.2026 · notatnik.mk · KREACJE · OBRAZY AI

TL;DR — Qwen-Image-2.1 to otwarty model Alibaby do generowania i edycji obrazów (wydany 20 września). Kilka dni później zespół Viggle opublikował do niego nakładkę „turbo”: obraz powstaje w 4–6 krokach zamiast 40, czyli kilka–kilkanaście razy szybciej, na tym samym sprzęcie. Jeden z użytkowników odpalił to na czterogigabajtowej karcie z biurowego laptopa. Dla kogoś, kto robi grafiki reklamowe do sklepu, to znaczy: lokalna, darmowa w użyciu produkcja packshotów i wariantów kreacji bez limitów API. Haczyk jest w licencji — model jest do celów niekomercyjnych — i o nim piszę najwięcej, bo tam większość ludzi się potknie.
Skąd te dane — informacje o modelu pochodzą z karty modelu Viggle/Qwen-Image-2.1-viggle-turbo na Hugging Face, z artykułu GIGAZINE z 24.09.2026 o Qwen-Image-2.1 oraz z wpisu AI Search na X (23.09.2026) i odpowiedzi pod nim. Wyniki wydajności (VRAM, czasy) to relacja jednego użytkownika, nie mój pomiar. Sam modelu jeszcze nie uruchomiłem — stąd plan testu na końcu.
4–6kroków generacji zamiast 40 w modelu bazowym
7 mldparametrów — mniej niż poprzednik Qwen-Image-2512
1,38 GBszczytowego VRAM w relacji użytkownika (wersja skwantyzowana Q3)
0 złza użycie — ale licencja badawcza, nie komercyjna

Co to jest Qwen-Image-2.1 i co robi „viggle turbo”

Dwa linki z WhatsAppa tego samego ranka: o 7:37 OpenAI z cenami (opisałem to we wpisie #052), a chwilę później wpis konta AI Search: „Qwen Image 2.1 viggle turbo. This generates images in only 4 steps instead of 40, making it way faster”. Krótko, bez fajerwerków — i właśnie dlatego kliknąłem.

// ŹRÓDŁO · X · @aisearchio · 23.09.2026

Qwen-Image-2.1 to model Alibaby do generowania obrazów z tekstu i edycji obrazów na podstawie jednego do trzech obrazów referencyjnych. Według GIGAZINE został wydany 20.09.2026, ma 7 miliardów parametrów (mniej niż poprzednik Qwen-Image-2512 ze stycznia), rozumie prompty po angielsku i japońsku, potrafi generować przezroczyste PNG i edytować istniejące zdjęcia.

Viggle turbo to nie nowy model, tylko adapter LoRA (ranga 256) nakładany na bazowy transformator. Wytrenowany metodą Distribution Matching Distillation z podejściem SenseFlow, pozwala generować obraz w 6 krokach (wersja v0.2.1) lub 4 krokach (starsza v0.1) zamiast 40. Karta modelu podaje uczciwe porównanie z bazą na 96 zapytaniach użytkowników: różnorodność 0,98× bazy, zerowy dryf kompozycji — ale wciąż „trudności ze złożonymi edycjami”.

Qwen-Image-2.1model bazowy · 40 kroków

+ LoRA turbodestylacja DMD

6 krokówten sam obraz, ułamek czasu

GGUF Q3wersja na 4 GB VRAM

Dlaczego 4 kroki zamiast 40 to nie tylko szybkość

Modele dyfuzyjne budują obraz iteracyjnie: każdy krok to jedno przejście przez sieć. 40 kroków to 40 przejść. Destylacja uczy model „skakać” — dochodzić do podobnego wyniku w kilku przejściach. Efekt to nie tylko krótszy czas:

  • Tańszy sprzęt. Skoro potrzeba 10× mniej obliczeń, ten sam obraz powstaje na karcie, która przy 40 krokach byłaby bezużyteczna.
  • Iteracja w pętli. Przy 3 minutach na obraz robisz 20 prób dziennie. Przy 20 sekundach — 200. To zmienia sposób pracy nad kreacją: z „zamawiania” na „szkicowanie”.
  • Warianty do testów. Dziesięć wersji tego samego packshotu w różnych tłach to w reklamie Meta dziesięć kreacji do testu, nie dziesięć zleceń dla grafika.

Cena, jaką się za to płaci, to zwykle różnorodność i precyzja w trudnych edycjach — karta modelu mówi o tym wprost. Dla packshotu na jednolitym tle to zwykle nie ma znaczenia; dla ilustracji z pięcioma postaciami i tekstem — może mieć.

Na jakim sprzęcie to chodzi — relacja z pola

Pod wpisem AI Search użytkownik podpisany jako SapiensIA opisał własny test: skwantyzowana wersja Qwen-Image-2.1 (Unsloth Dynamic 2.0, Q3_K_XL) z nakładką Viggle Turbo i EasyCache na karcie NVIDIA Quadro T1000 z 4 GB — czyli GPU z biurowego laptopa sprzed kilku lat. Szczytowe zużycie pamięci: 1,38 GB. Tempo: 28 sekund na krok, 6 kroków = 2 min 49 s na obraz.

ŹródłoSprzętCzas na obraz 1024×1024Uwagi
GIGAZINE (model bazowy)Intel Arc Pro B70 32 GB + Ryzen 5 7600Xok. 45 s pierwszy, ok. 30 s kolejnebez nakładki turbo, pełna precyzja
Użytkownik na X (turbo, Q3)NVIDIA Quadro T1000 4 GB2 min 49 s (6 kroków)1,38 GB VRAM; sprzęt z dolnej półki
Mój test——jeszcze nie zrobiony, patrz plan

Dwie relacje, żadna moja. Liczby traktuję jako orientacyjne, dopóki nie zmierzę na własnym komputerze.

Trzy minuty na obraz na 4 GB to nie jest „szybko”. To jest „w ogóle możliwe” — i to jest news. Na karcie z 12–16 GB, których pełno w komputerach do gier, ten sam proces powinien schodzić do sekund. Powinien — sprawdzę.

Licencja: to jest miejsce, w którym ludzie się potykają

Karta modelu Viggle podaje licencję Qwen Research License Agreement: użycie wyłącznie niekomercyjne (badania, ocena); użycie komercyjne wymaga osobnej licencji od Alibaby. GIGAZINE dodaje, że umowa zabrania komercyjnego użycia modelu, ale Alibaba wyjaśniła, iż „prawa do obrazów tworzonych przez użytkowników należą do nich”.

Przeczytaj to dwa razy, bo tu jest pułapka. „Prawa do obrazów należą do użytkownika” to nie to samo co „możesz używać modelu komercyjnie”. Generowanie grafik do reklamy sklepu jest użyciem modelu w celu komercyjnym. Moja interpretacja — a nie jestem prawnikiem i to nie jest porada prawna: do pracy w sklepie potrzebna jest licencja komercyjna albo model z licencją, która ją dopuszcza. Zanim ktoś wrzuci packshot z Qwen do kampanii, powinien przeczytać aktualny tekst licencji, a nie wpis na X ani ten notatnik.

To samo dotyczy kwantyzacji i konwersji publikowanych przez osoby trzecie (GGUF, wersje „comfy”): odziedziczają licencję modelu bazowego. Że plik da się pobrać, nie znaczy, że wolno go użyć w reklamie.

Do czego w reklamie: packshoty, warianty, przezroczyste PNG

  1. Przezroczyste PNG — model potrafi je generować natywnie. Dla sklepu to koniec ręcznego wycinania tła: produkt na przezroczystym tle wchodzi do każdego szablonu banera.
  2. Edycja z referencją (1–3 obrazy) — ten sam produkt w innym otoczeniu, na innym stole, w innym świetle. To jest generator wariantów do testów A/B kreacji.
  3. Tło do rolek — klatki tła do wideo, które potem animujemy (o previzie pisałem w wpisie #045).
  4. Szkice dla grafika — najmniej efektowne, najbardziej praktyczne: 20 wersji kompozycji w 10 minut, żeby grafik nie zgadywał, co masz w głowie.

Czego bym nie robił: generował zdjęć „prawdziwych klientów”, podrabiał stylu konkretnych ilustratorów, wstawiał wygenerowanych ludzi jako autorów opinii. Nie ze względu na licencję — ze względu na to, że w sklepie sprzedaję zaufanie, a to się nie regeneruje w 6 krokach.

Lokalnie czy API — rachunek dla małego sklepu

KryteriumLokalnie (Qwen + turbo)API zamkniętego dostawcy
Koszt jednostkowyprąd + czas; praktycznie zero po zakupie kartystała stawka za obraz
Koszt wejściakarta graficzna, konfiguracja, aktualizacjekarta kredytowa
Licencja komercyjnado sprawdzenia — w tym przypadku wymaga osobnej umowyzwykle w cenie usługi
Prywatność danychprodukty nie wychodzą z firmyzdjęcia idą do dostawcy
Jakość szczytowazależna od modelu i sprzętuzwykle wyższa w najtrudniejszych zadaniach
Kto naprawia, gdy nie działatysupport

Dla sklepu z tysiącem produktów i stałą potrzebą wariantów kreacji lokalny model jest kuszący. Warunek: karta i licencja, w tej kolejności ważności — odwrotnie niż zwykle ludzie to sprawdzają.

Plan testu w tym notatniku

Model nie jest jeszcze u mnie uruchomiony. Plan:

  1. Przeczytać pełny tekst Qwen Research License Agreement i zapisać w notatniku, co dokładnie wolno na tej licencji. Bez tego nic dalej nie ma sensu.
  2. Uruchomić bazowy Qwen-Image-2.1 i wersję z nakładką turbo na moim komputerze. Zmierzyć: czas na obraz 1024×1024, zużycie VRAM, 10 obrazów z tego samego promptu — ocenić powtarzalność.
  3. Test na zadaniu ze sklepu, ale tylko do oceny wewnętrznej (licencja badawcza): 5 produktów × 4 tła z referencji + przezroczyste PNG. Ślepa ocena przez żonę: nadaje się / nie nadaje.
  4. Wpis z tabelą czasów i ocen. Jeśli jakość nie wystarcza do packshotu — piszę to i wracam do API.

FAQ

Co to jest Qwen-Image-2.1 viggle turbo?

Adapter LoRA od zespołu Viggle nakładany na otwarty model Qwen-Image-2.1 Alibaby, wytrenowany metodą destylacji (DMD), który pozwala generować obraz w 4–6 krokach zamiast 40 — kilka do kilkunastu razy szybciej na tym samym sprzęcie.

Czy Qwen-Image-2.1 jest darmowy?

Wagi są dostępne bez opłat, ale na licencji badawczej Qwen Research License Agreement, która dopuszcza tylko użycie niekomercyjne. Użycie komercyjne — w tym grafiki do reklam — wymaga osobnej licencji od Alibaby.

Na jakim sprzęcie działa Qwen-Image-2.1 turbo?

Według relacji użytkownika na X, skwantyzowana wersja Q3 z nakładką turbo zajęła 1,38 GB VRAM na karcie NVIDIA Quadro T1000 4 GB i generowała obraz w 2 min 49 s. Na mocniejszych kartach czasy powinny być znacznie krótsze; własnych pomiarów jeszcze nie mam.

Czy mogę użyć obrazów z Qwen-Image w reklamie sklepu?

Prawa do wygenerowanych obrazów należą według Alibaby do użytkownika, ale samo użycie modelu w celu komercyjnym wymaga licencji komercyjnej. Nie jestem prawnikiem — przeczytaj aktualny tekst licencji przed użyciem w kampanii.

Co traci model przy generowaniu w 6 krokach?

Według karty modelu: różnorodność 0,98× bazy, brak dryfu kompozycji, ale wciąż trudności ze złożonymi edycjami. Dla prostych packshotów różnica jest zwykle niewidoczna; dla skomplikowanych scen może być.

Źródła

Powiązane w notatniku: GPT-6 Sol i Luna — ceny API, previz Blender → Seedance, Fish Audio — głos AI do reklam.

// tagi: #Qwen Image #generowanie obrazów #open source AI #generowanie kreacji #narzędzia AI

— MK · wróć do notatnika

← wszystkie tematy notatnika

Wcześniej w notatniku

Kto to pisze

Mateusz Kwiecień. Prowadzę z żoną sklep kwiecien.academy i testuję na nim reklamę online oraz SEO — za własne pieniądze. Ten notatnik to zapis tych testów: liczby, wnioski i błędy. Pomylę się — poprawiam wpis, nie kasuję.

Najnowsze wpisy

Kampania pali budżet?

Masz pytanie, którego nie ma w notatniku? Napisz — sprawdzę u siebie i dopiszę. Bez „szanowny specjalisto” i bez formularza z dwunastoma polami.