PixVerse ra mắt R2, đưa mô hình thế giới thời gian thực đến các thế giới bền vững, có thể chơi
R2 nâng cấp mô hình thế giới thời gian thực của PixVerse để xử lý thêm dữ liệu, tác vụ và loại đầu vào, đồng thời vẫn vận hành theo thời gian thực.
Việc tạo video AI bằng các mô hình nền tảng thường diễn ra một lần. Mô hình nhận một câu lệnh, tạo một đoạn clip cố định rồi dừng lại. Để thay đổi, người dùng phải bắt đầu lại bằng một câu lệnh và đoạn clip mới. Mỗi kết quả đều khép kín và rời rạc.
Mô hình thế giới thời gian thực hoạt động khác. Thay vì trả về một đoạn clip, mô hình tạo ra một thế giới tiếp tục vận hành khi người dùng ở trong đó. Thế giới có thể được khám phá theo thời gian thực. Đầu vào mới đến khi mô hình vẫn đang tạo và làm thay đổi điều xảy ra tiếp theo. Thế giới không đặt lại giữa các hành động, giữ trạng thái xuyên suốt và duy trì tính nhất quán khi phiên hoạt động kéo dài hơn.
PixVerse đã giới thiệu R1, mô hình thế giới thời gian thực đầu tiên trên thế giới, vào tháng 1 năm 2026. R1 chứng minh mô hình này khả thi: video có thể trở thành một luồng nghe nhìn liên tục, có tính tương tác thay vì một đầu ra cố định.
Hôm nay, chúng tôi ra mắt R2, bản nâng cấp cho mô hình thế giới thời gian thực. R2 duy trì tính nhất quán qua những phiên dài hơn nhiều, ghi nhớ những gì xảy ra trong một phiên và mang chúng đi tiếp, đồng thời đưa văn bản, tài liệu tham chiếu, âm thanh và điều khiển hành động vào cùng một thế giới đang vận hành.
Một Thế Giới Ghi Nhớ và Phản Hồi
Thay đổi cốt lõi của R2 là những gì đầu vào có thể làm. Trong video AI thông thường và các phiên bản tạo thời gian thực trước đây, đầu vào tác động đến khoảnh khắc hiện tại, rồi khoảnh khắc đó trôi qua. Hành động tiếp theo bắt đầu mới. Thế giới không mang gì đi tiếp.
Trong R2, đầu vào được duy trì. Một câu lệnh, một hành động hay tín hiệu âm thanh không chỉ thay đổi khung hình hiện tại. Chúng cập nhật trạng thái đang vận hành của thế giới và định hình những gì theo sau: cách nhân vật hành xử về sau, cách một tình huống được giải quyết và cách môi trường phát triển khi phiên tiếp tục. Một hành động trước đó vẫn có giá trị về sau trong cùng một phiên.
Khám phá một thế giới sống động. Người chơi đi vào một thế giới được tạo và di chuyển trong đó theo thời gian thực, điều khiển nhân vật bằng các phím WASD và thay đổi góc máy bằng các phím mũi tên. Các câu lệnh thay đổi thế giới khi người chơi tiến bước, thêm yếu tố và biến đổi môi trường. Nhân vật tương tác với môi trường xung quanh theo một cảm nhận về logic vật lý, và mỗi đầu vào đều xây dựng trên đầu vào trước thay vì bắt đầu lại từ đầu.
Định hình câu chuyện. Thế giới có thể phát triển một cốt truyện uốn theo những gì người chơi làm. Trong Zero Mark, một trò chơi điện ảnh tương tác được nhà sáng tạo Xiaolongbao xây dựng trên R2, một sinh vật chặn đường và xin quà. Tặng nó một con rồng hoặc một chiếc lá dẫn đến các phản hồi thực sự khác nhau. Câu chuyện phân nhánh từ đầu vào thay vì đi theo lối mòn được viết sẵn, và mô hình tạo từng kết quả theo thời gian thực.

Trong Zero Mark, cùng một cuộc chạm trán đi theo hai hướng: tặng sinh vật một con rồng hoặc một chiếc lá tạo ra các phản hồi khác nhau, được tạo theo thời gian thực.
Những nhân vật phản hồi theo ngữ cảnh. Các nhân vật trong thế giới có thể hiểu người chơi và phản hồi nhịp nhàng với câu chuyện. Trong một câu chuyện tương tác do nhà sáng tạo Jade Wu xây dựng trên R2, người chơi trò chuyện với nhân vật Eve, người duy trì danh tính và ký ức xuyên suốt cuộc trò chuyện, gợi mở manh mối và thúc đẩy cốt truyện. Câu trả lời, biểu cảm và chuyển động của cô theo sát cả cuộc trò chuyện đã diễn ra lẫn vị trí mà câu chuyện đã đi tới. Cô giữ một danh tính nhất quán qua nhiều lần trao đổi thay vì đặt lại, giống một người biết bạn và theo dõi điều đang xảy ra hơn là một nhân vật không phải người chơi theo kịch bản.
Bài Toán Mở Rộng Quy Mô và Câu Trả Lời của R2
Không giống việc tạo một đoạn video cố định, nơi mô hình nhận một câu lệnh và một khoảng thời gian cố định để lấp đầy, một thế giới tiếp tục vận hành không có ranh giới như vậy. Nó phải liên tục làm nhiều việc cùng lúc mà không đổ vỡ:
- Duy trì tính nhất quán theo thời gian. Nhân vật, địa điểm và các quy tắc của thế giới phải giữ nguyên. Mỗi giây vận hành bổ sung lại là một cơ hội để sai lệch.
- Nhận đầu vào giữa quá trình tạo. Mô hình không thể dừng lại để suy nghĩ. Điều khiển mới đến khi thế giới đang chuyển động và phải được tích hợp mà không dừng lại.
- Ghi nhớ và phục hồi. Mô hình phải mang theo những gì đã xảy ra; khi các lỗi nhỏ tích lũy trong một phiên dài, mô hình phải sửa chúng thay vì làm chúng chồng chất.
- Thực hiện tất cả theo thời gian thực. Ngân sách độ trễ phải đủ thấp để tạo cảm giác tương tác.
Bên dưới các yêu cầu này là một sự căng thẳng sâu hơn. Cách thông thường để làm mô hình đủ nhanh cho thời gian thực là đơn giản hóa nó, còn cách thông thường để làm nó có năng lực hơn là khiến nó nặng hơn và chậm hơn. Tốc độ và năng lực kéo ngược nhau. Cách tiêu chuẩn mà lĩnh vực này xây dựng các hệ thống đó làm vấn đề trầm trọng hơn: một chuỗi dài các giai đoạn huấn luyện riêng biệt, mỗi giai đoạn bàn giao cho giai đoạn tiếp theo, với chất lượng và độ ổn định giảm đi ở mỗi lần bàn giao.
Câu trả lời của R2 là ngừng ép buộc lựa chọn giữa tốc độ và năng lực, rồi chia công việc thành hai giai đoạn được xây dựng trên cùng một nền tảng. Omni Causal AR là động cơ năng lực, hoạt động như một nền tảng cốt lõi được huấn luyện liên tục. Nó phát triển một mô hình nhân quả duy nhất tiếp tục học qua nhiều dữ liệu hơn, nhiều loại đầu vào hơn, nhiều tác vụ hơn và khoảng thời gian dài hơn, tích lũy năng lực ở một nơi thay vì suy giảm qua các lần bàn giao.
Sau đó, lớp tăng tốc thời gian thực lấy chính mô hình đó và nén nó để vận hành trực tiếp, thay vì huấn luyện một mô hình nhanh riêng biệt từ đầu. Nhờ vậy, việc tăng năng lực không còn phải đánh đổi bằng tốc độ.

R2 thay thế quy trình huấn luyện nhiều bước truyền thống, nơi chất lượng suy giảm ở mỗi lần bàn giao, bằng một mô hình duy nhất được huấn luyện liên tục và nén cho việc sử dụng theo thời gian thực.
Bao quanh hai giai đoạn này là một tập hợp các lựa chọn kỹ thuật có chủ đích, để mỗi tiến bộ về năng lực đều có thể đi đến sản phẩm thời gian thực. Báo cáo kỹ thuật PixVerse R2 đầy đủ bao gồm chi tiết về kiến trúc và đánh giá.
“Các mô hình ngôn ngữ lớn đã cho thấy mở rộng quy mô là một con đường đáng tin cậy dẫn đến năng lực,” Changhu Wang, đồng sáng lập kiêm CEO của PixVerse, cho biết. “R2 là ví dụ của chúng tôi cho thấy các mô hình thế giới thời gian thực có thể đi theo con đường tương tự: với kiến trúc phù hợp, một mô hình có thể tiếp tục trở nên có năng lực hơn mà không phải từ bỏ tương tác thời gian thực. Theo thời gian, đó là cách một công cụ sáng tạo trở thành môi trường mà mọi người có thể bước vào và định hình.”
Từ Mô Hình Thế Giới đến Các Trò Chơi Có Thể Chơi
R2 đã vượt từ trình diễn nghiên cứu sang nền tảng mà các sản phẩm thực có thể xây dựng trên đó. Ra mắt lần đầu vào tháng 7 năm 2026, PixVerse Game Engine hiện chạy trên R2.

Chow Li, Trưởng bộ phận PixVerse Games, trình bày công cụ trò chơi thời gian thực của PixVerse tại Tech in Asia Conference, tháng 9 năm 2026.
Khi trình bày tại Tech in Asia Conference vào tháng 9, Chow Li, Trưởng bộ phận Games của PixVerse, đã định vị đây là sự chuyển đổi trong việc một trò chơi có thể là gì. Những thành phần truyền thống tạo nên một trò chơi—nhân vật, thế giới và các lựa chọn của người chơi—không còn là tài sản cố định được xây dựng trước. Người chơi giờ đây có thể nói điều mình muốn và thấy nó xảy ra; trải nghiệm hình thành qua quá trình chơi thay vì được tạo tác từ trước. Việc tạo ra thế giới và chơi nó trở thành cùng một hành động.

Jaden Xie, đồng sáng lập kiêm Chủ tịch PixVerse, phát biểu trong một phiên thảo luận tại Google AI App Day ở Singapore, tháng 9 năm 2026.
Phát biểu trong một phiên thảo luận tại Google AI App Day ở Singapore, đồng sáng lập kiêm Chủ tịch Jaden Xie chỉ ra rằng những tiến bộ trong mô hình video là động lực mạnh mẽ cho làn sóng trò chơi AI-native tiếp theo. Jaden nói: “Điều thú vị là những gì các nhà sáng tạo đã xây dựng trên mô hình thế giới của chúng tôi kể từ khi chúng tôi mở beta vào tháng 7. Chúng tôi tin rằng các mô hình video sẽ giúp nhiều nhà sáng tạo hơn biến ý tưởng của họ thành hiện thực.”
Khả Năng Truy Cập
Bộ sưu tập các thế giới này hiện đã mở để khám phá tại world.pixverse.video.
Giới Thiệu về PixVerse
PixVerse là nền tảng tạo video AI toàn cầu được hơn 150 triệu người dùng tại hơn 177 quốc gia tin cậy. Với bộ mô hình độc quyền được phát triển hoàn toàn nội bộ, PixVerse cho phép bất kỳ ai tạo video chất lượng điện ảnh từ câu lệnh, ảnh hoặc clip. Tháng 1 năm 2026, PixVerse ra mắt R1, mô hình thế giới thời gian thực đầu tiên trên thế giới, biến video thành một luồng vô hạn, liên tục và tương tác. R2 xây dựng trên nền tảng đó, mở rộng mô hình thế giới thời gian thực để vận hành các phiên dài hơn và nhất quán hơn. Với các đội ngũ phân bổ trên khắp châu Á và Hoa Kỳ, PixVerse được thành lập năm 2023 với cam kết biến video thành ngôn ngữ phổ quát của biểu đạt con người. Tháng 3 năm 2026, PixVerse hoàn tất vòng Series C, đạt trạng thái kỳ lân. Để biết thêm thông tin, hãy truy cập pixverse.ai.