2026年9月10日

Pertarungan Besar Fei-Fei Li dan LeCun dalam Dunia World Model

Jalan menuju AGI akhirnya bertemu di satu arena pertarungan yang sama—world model. Fei-Fei Li resmi ...

Jalan menuju AGI akhirnya bertemu di satu arena pertarungan yang sama—world model.

Fei-Fei Li resmi meluncurkan Marble, world model komersial pertama dari perusahaannya.

Hampir pada waktu yang sama, Yann LeCun memilih keluar dari Meta untuk membangun perusahaan baru yang sepenuhnya berfokus pada world model.

Sebelum itu, Google sudah lebih dulu mengguncang industri melalui world model mereka, Genie 3.

Tiga kekuatan besar AI ini memang sama-sama memasuki ranah world model, tetapi masing-masing membawa taruhan teknologi yang sepenuhnya berbeda.

Pertarungan world model pun dimulai.

Setelah merilis tulisan panjang tentang pentingnya kecerdasan ruang, startup Fei-Fei Li, World Labs, langsung bergerak cepat memperkenalkan Marble sebagai world model komersial pertama mereka.

Tim pengembang menjelaskan bahwa pendekatan ini mampu secara signifikan mengurangi distorsi adegan serta ketidakkonsistenan detail. Marble juga dapat mengekspor dunia yang dihasilkan dalam bentuk Gaussian splats, mesh, bahkan langsung sebagai video.

Lebih dari itu, Marble hadir dengan editor dunia AI bawaan bernama Chisel. Hanya dengan satu prompt sederhana, pengguna bisa mengubah dunia sesuai imajinasi mereka.

Bagi pengembang VR dan game, alur kerja seperti “satu prompt → langsung jadi dunia 3D → sekali klik ekspor ke Unity” benar-benar terasa seperti sihir.

Namun, seorang insinyur machine learning di Hacker News menilai bahwa Marble lebih mirip model rendering 3D daripada world model sejati.

“Bukankah ini cuma Gaussian Splat versi mewah? Bertahun-tahun terjun di AI, sampai hari ini saya masih bingung ‘dunia’ seperti apa yang dimaksud dalam world model.”

Komentar di Reddit bahkan lebih lugas:

“Mengubah gambar menjadi lingkungan 3D dengan Gaussian splatting, depth, dan inpainting memang keren, tapi ini hanya pipeline Gaussian 3D—bukan otak robot.”

Gaussian splatting sendiri adalah salah satu teknologi paling panas di dunia 3D dalam beberapa tahun terakhir.

Teknik ini merepresentasikan adegan sebagai ribuan titik Gaussian berwarna yang mengambang di ruang 3D, lalu “disemprotkan” ke layar sehingga menyatu menjadi gambar.

Bayangkan setiap Gaussian seperti gelembung kecil transparan dengan tepi lembut yang melayang di udara.

Satu gelembung tidak berarti apa-apa, tetapi ketika ribuan gelembung itu dirender dari berbagai sudut, ia berubah menjadi visual 3D yang memukau.

Metode ini menghindari proses photogrammetry tradisional yang rumit. Meskipun akurasi sedikit berkurang, kecepatannya jauh lebih tinggi dan jauh lebih mudah diedit.

Inilah jalur utama yang dipilih Marble.

Namun, itu juga berarti Marble mungkin bukan world model yang dapat langsung melatih robot seperti yang dibayangkan banyak orang.

Marble memang membangun sebuah dunia lengkap, tetapi yang kita lihat hanyalah tampilan yang bisa dirender—bukan struktur fisik yang mengatur bagaimana dunia tersebut beroperasi.

Marble menangkap “seperti apa dunia itu”, tetapi tidak memahami “mengapa dunia bekerja demikian”.

Untuk manusia, itu cukup. Tapi bagi robot, hal terpenting justru struktur kausal di baliknya.

Contohnya sederhana: manusia langsung mengerti bahwa bola di atas lereng akan menggelinding turun. Bagi robot, ia butuh informasi tentang massa, gesekan, dan kecepatan—variabel yang sama sekali tidak ada di Marble.

Tak heran di blog resminya, Marble sering membahas “world model,” “Gaussian splats,” atau “mesh,” tetapi hampir tak pernah menyebut robot.

Meski begitu, di sisi komersial, Marble berada di posisi yang sangat menguntungkan.

Berbeda dengan world model riset yang kompleks dan abstrak, Marble langsung relevan untuk workflow game development dan VR—praktis dan siap dipakai.

Tetapi ini memunculkan pertanyaan: apakah jalan menuju AGI lewat world model hanya slogan belaka?

Jawabannya: tentu tidak.

Ada world model yang benar-benar dibangun untuk kecerdasan robotik—misalnya JEPA dari LeCun.

Menurut LeCun, world model tidak dimulai dari grafika 3D, tetapi berakar pada teori kontrol dan ilmu kognitif.

World model jenis ini tidak menghasilkan visual cantik, karena bukan untuk dilihat manusia.

Tugasnya adalah membantu robot memikirkan langkah ke depan—memprediksi perubahan dunia sebelum bertindak.

Itulah filosofi JEPA.

LeCun berpendapat bahwa yang penting bagi AI hanyalah representasi abstrak di tengah. Model tidak perlu membuang sumber daya untuk menghasilkan piksel; cukup fokus pada status dunia yang relevan untuk pengambilan keputusan.

Karena itu, meski JEPA tidak dapat menghasilkan visual 3D seindah Marble, ia jauh lebih mirip dengan “otak” robot.

Ia mempelajari struktur terdalam dunia—menjadikannya tempat latihan ideal untuk embodied intelligence.

Perbedaan keduanya pun menjadi sangat jelas:

Fei-Fei Li membangun generator aset front-end.
LeCun membangun mesin prediksi back-end.

Di antara keduanya, berdirilah raksasa teknologi lain: Google.

Pada bulan Agustus, Google DeepMind memperkenalkan Genie 3, world model generasi baru mereka.

Dengan satu prompt, Genie 3 dapat menciptakan lingkungan video interaktif yang dapat dijelajahi pengguna selama beberapa menit.

Pencapaian terbesarnya adalah keberhasilannya menjaga konsistensi jangka panjang—tidak ada lagi fenomena “baru berbalik badan, gedung tiba-tiba hilang.”

Genie 3 juga mendukung peristiwa dunia seperti “mulai hujan” atau “hari mulai gelap,” membuat lingkungan terasa seperti game engine hidup yang dikendalikan AI.

Namun, pada intinya, Genie lebih tepat disebut “video generator berinspirasi world model.”

Meski dapat menghasilkan dunia bergerak, logikanya tetap video-sentris, bukan kausalitas fisik seperti pada JEPA.

Genie tetap dapat dipakai untuk melatih agen AI, tetapi kedalaman fisiknya masih jauh dari JEPA.

Di sisi lain, kualitas gambar dan resolusi Genie tidak mendekati aset 3D berpresisi tinggi milik Marble.

Jika disimpulkan, ketiga world model ini memang menggambarkan “dunia,” tetapi melalui tiga sudut pandang yang benar-benar berbeda:

Marble memperlihatkan seperti apa dunia itu.
Genie 3 memperlihatkan bagaimana dunia bergerak.
JEPA berusaha memahami mengapa dunia bekerja demikian.

Hampir semua world model modern dapat dikelompokkan dalam tiga kategori ini:

1. World Model sebagai Antarmuka (Interface)
Dipimpin oleh Marble—menghasilkan dunia 3D yang indah dan dapat diedit, terutama untuk manusia.

2. World Model sebagai Simulator
Dipimpin oleh Genie 3—lingkungan dinamis yang dapat dikendalikan, tempat agen belajar dengan mencoba dan gagal.

3. World Model sebagai Kerangka Kognitif
Dipimpin oleh JEPA—semua tentang variabel laten dan transisi status, dunia ideal bagi robot untuk belajar memahami sebab-akibat.

Menurut peneliti Zhao Hao, ketiganya dapat disusun menjadi “Piramida World Model”: bagian dasar adalah Fei-Fei Li, bagian tengah Genie 3, dan bagian puncak adalah LeCun.

Semakin ke atas, world model semakin abstrak dan semakin dekat dengan cara berpikir AI—lebih cocok untuk robot.

Semakin ke bawah, dunia semakin indah, interaktif, dan mudah dipahami manusia—tetapi justru makin sulit dipahami robot.

Perlombaan world model baru saja dimulai.

Jalur mana yang benar-benar membawa kita menuju AGI masih menjadi pertanyaan terbuka—tetapi satu hal jelas: persaingan antara Fei-Fei Li, LeCun, dan Google kini sedang membentuk masa depan sistem kecerdasan generasi berikutnya.

接著讀