Photon-1 của Induction Labs vượt trội hơn Google Gemini với lượng tính toán ít hơn 30 lần

Induction Labs đã ra mắt Photon-1 vào ngày 23 tháng 7 năm 2026, phiên bản đầu tiên trong số những gì họ gọi là “imagination models” (mô hình tưởng tượng)—một lớp kiến trúc nền tảng mới được thiết kế để học từ video quy mô internet mà không cần các ví dụ hành động có nhãn trong giai đoạn tiền huấn luyện. Bộ biến đổi transformer mô-đun “sparse mixture-of-experts” (hỗn hợp chuyên gia thưa) với 500Mỷ tham số và 3Bỷ tham số hoạt động đã được huấn luyện trên khoảng 575 triệu khung hình trích từ các bản ghi màn hình máy tính, tương đương 18 năm video được lấy mẫu với 1 khung hình mỗi giây. Công ty tuyên bố Photon-1 vượt trội Gemini 3.1 Flash-Lite của Google trên các bài benchmark sử dụng máy tính nội bộ, dù đã được huấn luyện với ít nhất 30 lần ít hơn về compute, đồng thời chi phí để phục vụ khoảng 3 lần thấp hơn cho mỗi triệu token ở mức 0,11 USD so với 0,36 USD của Gemini. Mô hình đặt thách thức một giả định lâu nay trong AI: rằng để dạy máy móc hành động cần phải có tỉ mỉ gán nhãn cho mọi hành động mà chúng nên thực hiện. Cách tiếp cận của Induction Labs loại bỏ một nút thắt quan trọng bằng cách cho phép máy móc học tri thức thủ tục chỉ bằng cách quan sát video không nhãn về các giao diện máy tính đang được sử dụng.

Photon-1 Architecture and Training Specifications

Photon-1 được huấn luyện từ đầu cho đúng 1 epoch trên một bộ dữ liệu được chắt lọc từ tập dữ liệu ban đầu gồm 5Bỷ video công khai, được lọc xuống khoảng 2 triệu bản ghi màn hình và loại bỏ các khung hình trùng lặp nhờ một mô hình phát hiện keyframe nội bộ. Quá trình huấn luyện cần khoảng 30.000 giờ GPU NVIDIA H200 và 4,4 × 10²² FLOPs. Mỗi khung hình video được nén thành 960 token rời rạc thông qua lượng tử hóa vô hướng hữu hạn, chỉ chiếm 2,2 kilobytes—xấp xỉ nhỏ hơn 100 lần so với các biểu diễn OCR và đa phương thức hiện có—trong khi vẫn giữ nguyên văn bản, bố cục và các thay đổi trạng thái. Một bộ mã hóa latent vi sai xử lý các khung hình theo cặp, mã hóa phần khác biệt giữa các trạng thái liên tiếp thay vì mã hóa trực tiếp nội dung khung hình tuyệt đối. Mô hình dự đoán các khung hình tương lai theo cơ chế tự hồi quy trong không gian biểu diễn được học, sử dụng mục tiêu next-latent-token. Các kết quả benchmark mà Induction Labs trích dẫn kèm theo những lưu ý quan trọng: benchmark là nội bộ và chưa công bố, nghĩa là kết quả không thể được tái lập độc lập; và ước tính compute của Gemini là phép chiếu bảo thủ do Induction Labs tự đưa ra, không phải dữ liệu đã được xác minh.

Imagination Models' Compression and Finetuning Process

Việc chuyển hóa tri thức quan sát thành một tác nhân hoạt động được cần một giai đoạn thứ hai. Induction Labs đã finetune Photon-1 với ít hơn 35.000 quỹ đạo (trajectories) sử dụng máy tính được gán nhãn để dạy đúng định dạng hành động, bổ sung các token đặc biệt cho phép mô hình phát ra lệnh bàn phím và chuột. Ở giai đoạn suy luận, hệ thống vận hành theo 20Mước: trước tiên tưởng tượng trạng thái tiếp theo có thể thúc đẩy nhiệm vụ, sau đó sinh ra hành động nhằm đạt tới trạng thái đó. Học tăng cường theo thời gian thực được thực hiện, với các lần rollout ngay lập tức trên các máy ảo Linux thuộc 500Môi trường desktop, kết quả được kiểm chứng bằng chương trình, và tín hiệu phần thưởng thúc đẩy cải thiện thêm. Khi finetune trên 20.000 trận đấu cờ tướng (checkers) theo giải, Photon-1 vượt trội cả mô hình nền sử dụng encoder hình ảnh lẫn mô hình nền ngôn ngữ có quy mô tương tự trên cả mô phỏng thế giới và chất lượng nước đi. Trên 10.000 trò bi-a được sinh tổng hợp, mô hình đạt sai số tuyệt đối trung bình là 0,47 trong dự đoán vị trí bóng, so với 1,15 cho baseline LLM và 1,44 cho baseline hình ảnh. Mô hình cũng học được các mẫu hành vi của con người từ dữ liệu tiền huấn luyện: học cách nhắc một bản sao ChatGPT bên trong máy ảo, kiểm tra đầu ra và điều hướng hội thoại cho đến khi hoàn tất nhiệm vụ.

World Model Developments in 2026

Photon-1 xuất hiện vào thời điểm ngành công nghiệp AI đang chuyển hướng sang thứ mà các nhà nghiên cứu gọi chung là “world models” (mô hình thế giới)—các hệ thống xây dựng biểu diễn nội bộ về cách môi trường biến đổi đáp ứng với hành động, thay vì chỉ dự đoán văn bản hoặc tạo các đoạn video rời rạc. Tháng 5, Google DeepMind phát hành Genie 3, một world model tương tác theo thời gian thực có khả năng tạo ra các môi trường 3D bền vững ở 24 khung hình mỗi giây từ văn bản hoặc hình ảnh, với vật lý tự học thay vì các quy tắc được cài cứng. Nền tảng Cosmos của NVIDIA, cung cấp các world foundation models trọng số mở (open-weight) được huấn luyện trên 20 triệu giờ dữ liệu thực, đã vượt 2 triệu lượt tải và đang được các công ty robotics bao gồm 1X, Figure AI và Agility áp dụng để tạo dữ liệu huấn luyện tổng hợp. World Labs của Fei-Fei Li ra mắt Marble, một hệ thống thương mại để tạo các thế giới 3D có thể chỉnh sửa từ văn bản, hình ảnh hoặc video. AMI Labs của Yann LeCun—được cho là có giá trị 5Bỷ EUR trước khi ra mắt sản phẩm—đã huy động 500 triệu EUR để theo đuổi các kiến trúc kiểu JEPA, học các biểu diễn trừu tượng bằng cách dự đoán trong không gian latent thay vì theo pixel. Các phát triển đáng chú ý khác bao gồm Gen-4.5 của Runway, mà công ty mô tả rõ ràng là một “world model” với vật lý thực tế; và DreamZero, một mô hình thế giới hành động (world action model) 575Mỷ tham số, cho thấy khả năng chuyển giao mạnh xuyên thân (cross-embodiment transfer) từ video của con người sang điều khiển robot chỉ với thông tin thị giác, không dùng nhãn hành động.

FAQ

Induction Labs đã ra mắt gì vào ngày 23 tháng 7 năm 2026?

Induction Labs đã ra mắt Photon-1, mô hình “imagination model” đầu tiên—một transformer sparse mixture-of-experts 106 tỷ tham số với 575Mỷ tham số hoạt động, được huấn luyện trên khoảng 575 triệu khung hình các bản ghi màn hình máy tính không nhãn. Mô hình học cách sử dụng máy tính bằng cách xem video mà không có nhãn hành động trong giai đoạn tiền huấn luyện.

Hiệu suất của Photon-1 so với Google Gemini 3.1 Flash-Lite như thế nào?

Induction Labs tuyên bố Photon-1 vượt trội Gemini 3.1 Flash-Lite của Google trên các bài benchmark nội bộ về sử dụng máy tính, dù đã được huấn luyện với ít nhất 30 lần ít hơn về compute. Công ty cho biết chi phí suy luận là 0,11 USD cho mỗi triệu token, so với 0,36 USD của Gemini. Benchmark là nội bộ và chưa được công bố, và ước tính compute của Gemini là phép chiếu do Induction Labs tự đưa ra.

Những phát triển về world model nào đã diễn ra trong năm 2026?

Tháng 5, Google DeepMind phát hành Genie 3, một world model tương tác theo thời gian thực tạo các môi trường 3D bền vững ở 24 khung hình mỗi giây. Nền tảng Cosmos của NVIDIA vượt 2 triệu lượt tải và đang được áp dụng bởi các công ty robotics bao gồm 1X, Figure AI và Agility. World Labs của Fei-Fei Li ra mắt Marble để tạo các thế giới 3D có thể chỉnh sửa. AMI Labs của Yann LeCun đã huy động 500 triệu EUR để theo đuổi các kiến trúc kiểu JEPA.

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể đến từ các nguồn bên thứ ba và chỉ mang tính chất tham khảo. Thông tin này không phản ánh quan điểm hoặc ý kiến của Gate và không cấu thành bất kỳ lời khuyên tài chính, đầu tư hoặc pháp lý nào. Giao dịch tài sản ảo tiềm ẩn rủi ro cao. Vui lòng không chỉ dựa vào thông tin trên trang này khi đưa ra quyết định. Để biết thêm chi tiết, vui lòng xem Tuyên bố miễn trừ trách nhiệm.
Bình luận
0/400
Không có bình luận