Meta Muse Realtime Avatar ma zamienić materiał referencyjny, na przykład fotograficzny portret, w postać zdolną do rozmowy na żywo: awatar mówi, porusza ustami i twarzą, a ilustracja całej sylwetki może gestykulować i zmieniać postawę. Meta pokazała tę technologię 23 września 2026 r. Twórcy, projektanci produktów i osoby śledzące generowanie obrazu oraz głosu przez AI znajdą tu odpowiedź na dwa pytania: co robi taki rozmówca i jak daleko demonstracja wykracza poza obecną aplikację Muse. Meta zaznacza, że nie wszystkie przykłady są awatarami dostępnymi w aplikacji; Muse jest przeznaczona dla osób od 18 lat. Meta AI Research
Co potrafi awatar AI na żywo?
Rozmowa z awatarem AI ma tu przypominać wymianę na żywo, a nie odtwarzanie wcześniej przygotowanego klipu. Meta opisuje fotograficzny portret reagujący subtelną mimiką, ilustrację całopostaciową wykonującą gesty i zmieniającą pozycję, a także zwierzęta i przedmioty, którym system nadaje ekspresję, zachowując ich rozpoznawalny wygląd. Firma deklaruje też ciągłość wyglądu i manier między kolejnymi turami. To opis możliwości modelu, nie obietnica, że każda fotografia da równie dobry rezultat. Meta AI Research
System łączy rozmowną część Muse Realtime Voice z wizualną częścią Realtime Avatar. Według opisu Meta głos powstaje ze strumienia tokenów mowy, które niosą zarówno treść, jak i sposób jej wypowiedzenia. Ten sam strumień zasila syntezę dźwięku i generowanie obrazu, co ma synchronizować głos, ruch ust oraz ekspresję. Innymi słowy, awatar nie jest samą „gadającą twarzą”: obraz stanowi jedną z warstw odpowiedzi systemu konwersacyjnego. Meta AI Research
Jak działa generowanie wideo w czasie rzeczywistym?
Meta określa Avatar jako model Diffusion Transformer sterowany tokenami mowy, materiałem referencyjnym i niedawnym kontekstem wygenerowanego wideo. Zamiast czekać na gotowy długi film, system tworzy krótkie fragmenty. Każdy nowy fragment może wykorzystać latenty poprzedniego jako kontekst ruchu, by podtrzymać wygląd i manierę postaci. Taki podział ma pozwalać na ciągłe generowanie podczas rozmowy przy ograniczeniu kosztu obliczeń i narastania błędów. To techniczny opis Meta; wpis nie daje podstaw, by ocenić jakość przy dowolnym zdjęciu czy długiej sesji. Meta AI Research
Firma podaje, że wideo portretowe ma rozdzielczość 448 × 768 pikseli i działa z szybkością 25 klatek na sekundę. Deklarowane opóźnienie wynosi około 870 ms, ale pomiar zaczyna się dopiero po zakończeniu tury użytkownika i kończy przy pierwszym bajcie zsynchronizowanej odpowiedzi głosowo-wizualnej. Nie oznacza to więc, że każda odpowiedź zaczyna się dokładnie po 870 ms od chwili, gdy użytkownik zacznie mówić. Meta podaje też wynik dla pojedynczej sesji na układzie GB200: krok generowania wytwarza osiem klatek, czyli 320 ms odtwarzania, w 20 ms czasu modelu. Są to parametry raportowane przez firmę dla opisanego systemu, a nie gwarantowany czas działania na urządzeniu odbiorcy. Meta AI Research
Czy rozmowa z awatarem AI jest już dostępna w Muse?
Nie należy utożsamiać demonstracji z pełnym wdrożeniem. Meta pisze wprost, że przykłady ilustrują możliwości modelu i nie wszystkie odzwierciedlają awatary dostępne w aplikacji Muse. Wpis opisuje sposób działania technologii, ale nie mówi, że użytkownik może już wgrać dowolne zdjęcie i uruchomić rozmówcę. Dlatego trafniej mówić o zaprezentowanej zdolności generowania wideo w czasie rzeczywistym niż o powszechnie dostępnej funkcji kreatora awatarów. Meta AI Research
Meta informuje także o własnym porównaniu z usługami Runway Characters i HeyGen LiveAvatar. Według wpisu osoby oceniające prowadziły rozmowy trwające od dwóch do trzech minut, używając dopasowanych tożsamości awatarów i natywnych trybów rozmowy w każdym produkcie. Meta podaje, że jej system częściej wygrywał ogółem oraz w każdej ocenianej kategorii, ale wynik porównania manier z Runway nie różnił się statystycznie od remisu. Ponieważ rezultaty pochodzą z ewaluacji opublikowanej przez samą Meta, warto traktować je jako wynik firmowego porównania, a nie niezależny werdykt. Meta AI Research
Co z tego wynika dla twórców i projektantów?
Dla twórcy postaci interesująca jest możliwość przejścia od nieruchomego projektu do reagującej osobowości. W demonstracji punktem odniesienia może być nie tylko portret, lecz także ilustracja, zwierzę czy przedmiot. Dla projektanta produktu ważniejszy od samej mimiki będzie cały przebieg interakcji: czy rozmówca czeka na koniec wypowiedzi, jak szybko zaczyna odpowiedź, czy ruch pozostaje spójny z tonem głosu i czy widać momenty, w których system „myśli”. To kryteria, które polecam sprawdzić w prototypie przed wyborem zastosowania.
Możliwym kierunkiem eksperymentu jest interaktywny przewodnik, postać edukacyjna lub bohater gry, ale sama technologia awatara nie rozstrzyga, czy takie doświadczenie będzie użyteczne. Jakość odpowiedzi zależy również od części konwersacyjnej, a zrozumiałość produktu — od jasnej informacji, że rozmówca jest generowany przez AI. Meta mówi, że wideo otrzymuje niewidoczny, trwały znak wodny Video Seal, który ma ułatwiać identyfikację wygenerowanych mediów bez dodatkowego opóźnienia. Taki znak jest warstwą identyfikowalności; sam w sobie nie zastępuje czytelnej informacji dla użytkownika. Meta AI Research
Wniosek: potencjał jest większy niż dostępność
Meta Muse Realtime Avatar pokazuje, jak rozmowa z awatarem AI może łączyć głosową odpowiedź z ruchem twarzy, rąk i całej sylwetki, generowanym na bieżąco. Wartość demonstracji leży w połączeniu tych warstw i deklarowanej ciągłości postaci. Dla osób projektujących produkty najważniejsza jest jednak informacja o dostępności: 23 września 2026 r. Meta zaprezentowała możliwości systemu, lecz zastrzegła, że przykłady nie oznaczają dostępności wszystkich postaci w aplikacji Muse. Meta AI Research
Źródła
- Bringing Your Muse to Life | Meta AI Researchresearch.meta.ai
- Runway Characters | Interactive AI Avatarsrunway.com
- Real-Time Avatar API by HeyGen — LiveAvatarliveavatar.com