
Jak używać AI
AI do wideo — co dziś naprawdę potrafi
Nie z zapowiedzi producenta, tylko z rachunku za własną produkcję. Ile trwa jeden klip, ile realnie kosztuje sekunda i które trzy ustawienia potrafią pomnożyć fakturę czterokrotnie.
Krótka odpowiedź
Trzy rzeczy, zanim zaczniesz liczyć na cuda
Klip trwa sekundy, nie minuty
Pojedyncze zamówienie to 4, 6 albo 8 sekund. Dłuższy materiał składasz z klipów w montażu — nie zamawiasz go jednym poleceniem. To najważniejsza rzecz, która różni wyobrażenie od praktyki.
Zaczyna się od obrazu
Najlepszą kontrolę daje tryb obraz do wideo: najpierw robisz kadr, potem model wprawia go w ruch. Dzięki temu kompozycja, światło i postać są ustalone, zanim cokolwiek się poruszy.
Płacisz za sekundę
Nie za klip i nie za abonament — za każdą wygenerowaną sekundę. Dlatego ustawienia domyślne, których nikt nie czyta, potrafią zrobić z drobnego zamówienia poważny rachunek.
Nazewnictwo
Szukasz Veo 3, a dziś stoi tam Veo 3.1
Veo to rodzina modeli wideo Google DeepMind. Nazwa, pod którą większość ludzi jej szuka, to wciąż „Veo 3″ — ale 5 września 2026 aktualną wersją jest Veo 3.1 i to ona stoi zarówno na stronie Google DeepMind, jak i u pośredników udostępniających model przez API.
To nie jest czepianie się cyferki. Numer wersji decyduje o tym, jakie masz do dyspozycji długości klipu, rozdzielczości i czy model potrafi wygenerować dźwięk — a każdy poradnik napisany pod poprzednią wersję będzie się w tych miejscach mylił. Dlatego przy każdej liczbie na tej stronie stoi data odczytu.
Do modelu można dotrzeć dwiema drogami: przez narzędzia samego Google albo przez pośrednika, który wystawia go jako API rozliczane za sekundę. My pracujemy tą drugą — i wszystkie liczby niżej pochodzą z naszych własnych faktur, nie z cennika w reklamie.
Najpierw kadr, potem ruch
W trybie obraz-do-wideo połowa roboty dzieje się jeszcze przed wideo — w generatorze obrazów. Jeśli kadr wyjściowy jest źle skomponowany, żadne polecenie ruchu tego nie naprawi.
Rachunek z produkcji
Ile kosztowało wideo, które oglądasz na naszej stronie głównej
Materiał w nagłówku Doba AI zrobiliśmy sami. Oto pełny rachunek, z liczbami z logu, a nie z pamięci.
01
Osiem klipów, 32 sekundy, 6,40 dolara
Tyle kosztowało wygenerowanie materiału źródłowego: osiem klipów po cztery sekundy, w 1080p, bez dźwięku. To wychodzi 20 centów za sekundę gotowego obrazu.
02
Na stronie zostało niecałe dziesięć sekund
Gotowy plik ma 9,92 sekundy, 1920 × 1080, 25 klatek na sekundę i waży 2,99 MB. Z 32 wygenerowanych sekund do montażu weszła mniej niż jedna trzecia — reszta poszła do kosza jako materiał, który nie trzymał ciągłości.
03
To samo zamówienie na ustawieniach domyślnych: 25,60 dolara
API domyślnie ustawia klip na osiem sekund i włącza generowanie dźwięku, a to podnosi stawkę z dwudziestu do czterdziestu centów za sekundę. Osiem klipów po osiem sekund z dźwiękiem to 64 sekundy po 0,40 — czterokrotność tego, co zapłaciliśmy. Za dźwięk, którego w tle strony i tak nie użyliśmy.
04
Saldo kłamie przez kilkanaście minut
Nasz pierwszy odczyt pokazał 3,20 dolara zamiast 6,40 — bo rozliczenie po stronie dostawcy schodzi z opóźnieniem. Gdybyśmy na tej podstawie zamówili drugą turę, rachunek byłby dwa razy większy, niż zakładaliśmy. Koszt sprawdzaj po ustabilizowaniu salda, nie zaraz po renderze.

Trzy pokrętła
Ustawienia, które mnożą rachunek
Wszystkie trzy są domyślnie ustawione tak, że płacisz więcej. To nie jest podstęp — to po prostu domyślne maksimum jakości.
Dźwięk: ×2
Generowanie ścieżki dźwiękowej jest domyślnie włączone i podwaja stawkę za sekundę. Jeśli robisz tło pod nagłówek strony — a takie wideo prawie zawsze chodzi bez dźwięku — wyłącz je jawnie, zanim wyślesz zamówienie.
Długość: ×2
Domyślne osiem sekund zamiast czterech to dwa razy więcej sekund do zapłacenia. Przy materiale montowanym z przebitek cztery sekundy wystarczają — dłuższe ujęcie i tak przycinasz.
Rozdzielczość: ×2
Skok do 4K podwaja stawkę jeszcze raz. Na stronie internetowej nie zobaczysz różnicy — 1080p to i tak więcej pikseli, niż zmieści się w tle nagłówka. My 4K mamy wprost wyłączone w narzędziu, żeby nikt go przypadkiem nie zamówił.
Czego nie mówi reklama
Trzy rzeczy, które zobaczysz dopiero przy pracy

Montaż jest większością roboty
Generowanie trwa minuty, składanie — godziny. Trzeba wybrać ujęcia, dociąć je, ustawić kolejność, dopasować tempo i kolor. Materiał z modelu jest surowcem, nie filmem, i to jest najczęściej pomijany koszt całej operacji.
Ta sama postać w dwóch klipach to dwie różne osoby
Każdy klip generuje się osobno, więc bohater z ujęcia pierwszego niekoniecznie jest tym samym człowiekiem w ujęciu drugim. Dlatego materiały tego rodzaju montuje się z przebitek, ogólnych planów i detali, a nie z rozmowy dwóch osób w polu i kontrpolu.
Odpad jest wliczony w cenę
U nas z 32 wygenerowanych sekund na stronę weszło niecałe dziesięć. Planując budżet, licz materiał, który zamówisz — nie ten, który zostanie na końcu. Stosunek trzy do jednego jest przy takiej robocie normą, a nie pechem.
Zastosowania
Do czego to się dziś nadaje, a do czego nie
Tła, przebitki, nastrój
Kilkusekundowe ujęcie w tle nagłówka, przebitka między scenami, materiał ilustracyjny bez dialogu. Tu ograniczenia modelu — krótkie klipy i zmienne postacie — przestają przeszkadzać, bo takiego materiału i tak nie ogląda się dłużej niż chwilę.
Szkic przed produkcją
Zanim wynajmiesz ekipę, możesz zobaczyć, jak mniej więcej wygląda pomysł w ruchu. Kilka dolarów zamiast dnia zdjęciowego — i wcześniejsza wiedza, że koncepcja nie działa.
Nie: dokumentacja i cudze twarze
Wygenerowane ujęcie nie jest zapisem zdarzenia i nie wolno go za takie podawać. Osobna sprawa to wizerunek rozpoznawalnej osoby i cudze znaki towarowe — w wideo wpadają w kadr równie łatwo jak w obrazie, a konsekwencje są takie same.
Pytania
Pięć pytań o generowanie wideo
Czym jest Veo 3 i czy to wciąż aktualna nazwa?
Veo to rodzina modeli wideo Google DeepMind. Większość ludzi szuka jej jako „Veo 3″, ale 5 września 2026 aktualną wersją jest Veo 3.1 — pod taką nazwą model stoi zarówno na stronie Google DeepMind, jak i u pośredników wystawiających go przez API.
Jak długi film mogę wygenerować za jednym razem?
Cztery, sześć albo osiem sekund — to cała lista długości pojedynczego zamówienia. Dłuższy materiał powstaje z montażu wielu klipów, a nie z jednego polecenia. Nasze dziesięciosekundowe wideo w nagłówku to montaż z ośmiu wygenerowanych ujęć.
Ile to kosztuje?
Płaci się za sekundę wygenerowanego materiału. W naszej produkcji wyszło 20 centów za sekundę przy 1080p bez dźwięku — 32 sekundy kosztowały 6,40 dolara. Z włączonym dźwiękiem stawka rośnie dwukrotnie, a 4K podwaja ją jeszcze raz.
Czy jest darmowy generator wideo AI?
Darmowe progi bywają w narzędziach konsumenckich, ale wideo jest nieporównanie droższe w liczeniu niż obraz, więc limity są tam wąskie i szybko się kończą. Przy pracy na serio i tak trafiasz na rozliczenie za sekundę — dlatego warto od razu policzyć, ile sekund naprawdę potrzebujesz.
Czy model wygeneruje też dźwięk i muzykę?
Ścieżkę dźwiękową potrafi wygenerować razem z obrazem — i domyślnie to robi, podwajając stawkę. Do wideo, które ma chodzić w tle strony, jest to zbędne. Muzyka to osobna kategoria narzędzi, rozliczana niezależnie od generatora wideo.
Skąd to wiemy
- Aktualna wersja modelu (Veo 3.1) i jego pochodzenie: strona modelu w Google DeepMind oraz karta modelu u pośrednika API, odczyt 5 września 2026.
- Dozwolone długości klipu (4 s / 6 s / 8 s), rozdzielczości i domyślne włączenie dźwięku: dokumentacja parametrów tego samego modelu w API, odczyt 5 września 2026.
- Wszystkie kwoty, czasy i proporcje odpadu: log kosztów naszej własnej produkcji z 25 sierpnia 2026 (osiem klipów, 32 sekundy, 6,40 dolara po ustabilizowaniu salda) oraz parametry pliku wideo z nagłówka tego serwisu.