PixVerse Apresenta R2 e Avança para Mundos Persistentes e Jogáveis
R2 é a evolução do modelo de mundo em tempo real da PixVerse, criado para lidar com mais dados, tarefas e tipos de entrada sem deixar de operar em tempo real.
A geração de vídeo por IA com modelos fundacionais costuma acontecer de uma só vez. Um modelo recebe um prompt, gera um clipe fixo e para. Para fazer alterações, o usuário precisa recomeçar com outro prompt e outro clipe. Cada resultado é fechado e independente.
Um modelo de mundo em tempo real funciona de outra forma. Em vez de devolver um clipe, ele gera um mundo que continua em execução enquanto o usuário está nele. O mundo pode ser navegado em tempo real. Novas entradas chegam enquanto o modelo ainda está gerando e mudam o que acontece em seguida. O mundo não é reiniciado entre ações e preserva seu estado durante toda a experiência, mantendo a consistência quanto mais longa for a sessão.
Em janeiro de 2026, a PixVerse apresentou o primeiro modelo de mundo em tempo real do mundo, R1. O R1 provou que esse paradigma era viável: o vídeo poderia se tornar um fluxo audiovisual contínuo e interativo, em vez de uma saída fixa.
Hoje, lançamos o R2, uma evolução do modelo de mundo em tempo real. Ele mantém a coerência por sessões muito mais longas, lembra o que acontece dentro de uma sessão e leva isso adiante, além de incorporar texto, referências, áudio e controles de ação ao mesmo mundo em execução.
Um Mundo que Lembra e Responde
A principal mudança do R2 está no que as entradas conseguem fazer. No vídeo de IA convencional e nas versões anteriores de geração em tempo real, uma entrada afeta o momento atual e então esse momento passa. A próxima ação começa do zero. O mundo não carrega nada adiante.
No R2, as entradas persistem. Um prompt, uma ação ou um sinal de áudio não apenas altera o quadro atual. Ele atualiza o estado em execução do mundo e molda o que vem depois: como um personagem se comporta mais tarde, como uma situação se resolve e como o ambiente se desenvolve conforme a sessão continua. Uma ação anterior continua válida mais adiante na mesma sessão.
Explore um mundo vivo. Um jogador entra em um mundo gerado e se move por ele em tempo real, controlando um personagem com as teclas WASD e ajustando a câmera com as setas. Os prompts transformam o mundo durante a exploração, adicionando elementos e modificando o ambiente. O personagem interage com os arredores seguindo uma lógica física, e cada entrada se baseia na anterior em vez de começar do zero.
Dê forma à história. O mundo pode desenvolver uma narrativa que se adapta às ações do jogador. Em Zero Mark, um jogo de filme interativo criado no R2 pelo criador Xiaolongbao, uma criatura bloqueia o caminho e pede um presente. Oferecer a ela um dragão ou uma folha leva a respostas realmente diferentes. A história se ramifica a partir da entrada, em vez de seguir um caminho pré-escrito, e o modelo gera cada resultado ao vivo.

Em Zero Mark, o mesmo encontro segue dois caminhos: oferecer à criatura um dragão ou uma folha produz respostas diferentes, geradas ao vivo.
Personagens que respondem ao contexto. Os personagens do mundo conseguem entender um jogador e responder acompanhando a história. Em uma história interativa criada pela criadora Jade Wu no R2, os jogadores conversam com uma personagem chamada Eve, que mantém identidade e memória ao longo da conversa, revelando pistas e fazendo a trama avançar. As respostas, expressões e movimentos dela acompanham tanto a conversa até aquele momento quanto o ponto alcançado pela história. Eve preserva uma identidade consistente em muitas interações, em vez de ser reiniciada, parecendo menos uma personagem não jogável roteirizada e mais alguém que conhece você e acompanha o que está acontecendo.
O Desafio da Escala e a Resposta do R2
Ao contrário da geração de um clipe de vídeo fixo, em que o modelo recebe um único prompt e um intervalo de tempo definido para preencher, um mundo que continua em execução não tem esse limite. Ele precisa fazer várias coisas ao mesmo tempo, continuamente, sem falhar:
- Manter a coerência ao longo do tempo. O personagem, o lugar e as regras do mundo precisam permanecer os mesmos. Cada segundo adicional de execução é mais uma oportunidade de desvio.
- Aceitar entradas durante a geração. O modelo não pode pausar para pensar. Novos controles chegam enquanto o mundo está em movimento e precisam ser incorporados sem interrupção.
- Lembrar e se recuperar. O modelo precisa levar adiante o que já aconteceu e, quando pequenos erros se acumulam em uma sessão longa, corrigi-los em vez de ampliá-los.
- Fazer tudo isso ao vivo. O orçamento de latência precisa permanecer baixo o suficiente para a experiência parecer interativa.
Por trás desses requisitos há uma tensão mais profunda. A forma usual de tornar um modelo rápido o suficiente para o tempo real é simplificá-lo, e a forma usual de torná-lo mais capaz é deixá-lo mais pesado e lento. Velocidade e capacidade puxam em direções opostas. A maneira padrão como o setor construiu esses sistemas agrava o problema: uma longa cadeia de etapas de treinamento separadas, cada uma passando o trabalho para a próxima, com qualidade e estabilidade se deteriorando a cada transição.
A resposta do R2 é deixar de forçar uma escolha entre velocidade e capacidade e dividir o trabalho em duas etapas construídas sobre a mesma base. Omni Causal AR é o motor de capacidade, funcionando como uma espinha dorsal treinada continuamente. Ele desenvolve um único modelo causal que continua aprendendo com mais dados, mais tipos de entrada, mais tarefas e períodos de tempo mais longos, acumulando capacidade em um só lugar em vez de degradá-la entre transferências.
A camada de aceleração em tempo real pega então esse mesmo modelo e o comprime para operar ao vivo, em vez de treinar do zero um modelo rápido separado. Assim, os ganhos de capacidade deixam de ocorrer às custas da velocidade.

Como o R2 substitui o pipeline convencional de treinamento em várias etapas, no qual a qualidade se deteriora a cada transição, por um único modelo treinado continuamente e comprimido para uso em tempo real.
Em torno dessas duas etapas há um conjunto de decisões de engenharia específicas que permitem que cada ganho de capacidade chegue ao produto em tempo real. O relatório técnico completo do PixVerse R2 apresenta a arquitetura e os detalhes de avaliação.
“Grandes modelos de linguagem mostraram que a escala é um caminho confiável para a capacidade”, disse Changhu Wang, cofundador e CEO da PixVerse. “O R2 é a nossa demonstração de que modelos de mundo em tempo real podem seguir um caminho semelhante: com a arquitetura certa, um modelo pode se tornar cada vez mais capaz sem abrir mão da interação em tempo real. Com o tempo, é assim que uma ferramenta de criação se torna um ambiente no qual as pessoas podem entrar e dar forma.”
Do Modelo de Mundo aos Jogos Jogáveis
O R2 passou de uma demonstração de pesquisa para algo sobre o qual produtos reais podem ser construídos. Lançado inicialmente em julho de 2026, o PixVerse Game Engine agora opera com o R2.

Chow Li, Head of PixVerse Games, apresentando o mecanismo de jogos em tempo real da PixVerse na Tech in Asia Conference, em setembro de 2026.
Durante sua apresentação na Tech in Asia Conference, em setembro, o Head of Games da PixVerse, Chow Li, descreveu isso como uma mudança no que um jogo pode ser. Os elementos que tradicionalmente fazem de um jogo um jogo — personagens, mundos e as escolhas do jogador — deixam de ser recursos fixos construídos antecipadamente. Agora, o jogador pode dizer o que quer e vê-lo acontecer, e a experiência toma forma durante a partida, em vez de ser criada previamente. Criar o mundo e jogá-lo passam a ser o mesmo ato.

Jaden Xie, cofundador e presidente da PixVerse, falando em um painel no Google AI App Day em Singapura, em setembro de 2026.
Em um painel no Google AI App Day, em Singapura, o cofundador e presidente Jaden Xie destacou os avanços em modelos de vídeo como um forte impulsionador da próxima onda de jogos nativos de IA. “O que nos anima é o que os criadores vêm desenvolvendo no nosso modelo de mundo desde que abrimos a beta em julho”, disse Jaden. “Acreditamos que nossos modelos de vídeo capacitarão mais criadores a dar vida às suas ideias.”
Disponibilidade
Uma coleção desses mundos já está aberta para exploração em world.pixverse.video.
Sobre a PixVerse
A PixVerse é uma plataforma global de geração de vídeo por IA em que confiam mais de 150 milhões de usuários em mais de 177 países. Com um conjunto de modelos proprietários desenvolvidos inteiramente internamente, a PixVerse permite que qualquer pessoa crie vídeos de qualidade cinematográfica a partir de um prompt, uma foto ou um clipe. Em janeiro de 2026, a PixVerse lançou o R1, o primeiro modelo de mundo em tempo real do mundo, transformando o vídeo em um fluxo infinito, contínuo e interativo. O R2 se baseia nessa fundação e amplia o modelo de mundo em tempo real para executar sessões mais longas e coerentes. Com equipes distribuídas pela Ásia e pelos Estados Unidos, a PixVerse foi fundada em 2023 com o compromisso de tornar o vídeo a linguagem universal da expressão humana. Em março de 2026, a PixVerse concluiu sua rodada Série C e alcançou o status de unicórnio. Para mais informações, visite pixverse.ai.