2026年9月10日

AI visi akhirnya memasuki “momen GPT”-nya — model terbaru Meta mampu membagi seluruh dunia hanya dengan satu klik, membuat warganet terkejut dan berkata: ini benar-benar gila!

Meta Hadirkan “Momen GPT untuk AI Visi”: SAM 3D Rekonstruksi Dunia dengan Satu Klik, SAM 3 Merevolus...

Meta Hadirkan “Momen GPT untuk AI Visi”: SAM 3D Rekonstruksi Dunia dengan Satu Klik, SAM 3 Merevolusi Segmentasi Gambar

Pada 20 November, Meta secara resmi merilis keluarga model rekonstruksi 3D SAM 3D, termasuk SAM 3D Objects untuk rekonstruksi objek dan adegan, serta SAM 3D Body untuk estimasi tubuh manusia secara 3D.

Yang paling mengejutkan:

Hanya dengan satu klik pada gambar 2D → model 3D lengkap dapat dihasilkan, bisa diputar 360° tanpa cacat.

Bersamaan dengan itu, Meta juga merilis SAM 3, model segmentasi generasi berikutnya dengan fitur terobosan: “segmentasi berbasis konsep dengan prompt.”

Banyak peneliti menyebut ini sebagai:

“Momen ChatGPT untuk Computer Vision.”


🧩 01. SAM 3D: Ubah Foto 2D Menjadi Model 3D dengan Satu Klik

SAM (Segment Anything Model) sebelumnya sudah menjadi model segmentasi 2D paling berpengaruh.
Sekarang, SAM 3D Objects menghadirkan:

  • Konversi gambar ke mesh 3D lengkap
  • Rekonstruksi bentuk, tekstur, dan pose
  • Dukungan untuk objek kecil dan occlusion
  • Hasil rekonstruksi yang hampir tanpa artefak

Untuk mengatasi minimnya data 3D di dunia nyata, Meta membangun dataset raksasa:

  • Hampir 1 juta gambar
  • 3,14 juta mesh 3D
  • Proses anotasi gabungan crowd worker + seniman 3D ahli

Meta juga membuat benchmark baru SA-3DAO dengan tingkat kesulitan lebih tinggi.

SAM 3D Objects mengalahkan model terbaik sebelumnya dengan rasio 5:1 pada preferensi manusia, dan mampu menghasilkan rekonstruksi 3D bertekstur penuh hanya dalam beberapa detik.


🧍 02. SAM 3D Body: Rekonstruksi Tubuh Manusia yang Lebih Interaktif

SAM 3D Body dirancang untuk estimasi tubuh 3D, mampu bertahan pada:

  • Pose ekstrem
  • Occlusion
  • Adegan banyak orang
  • Busana kompleks

Kuncinya adalah format mesh baru MHR (Meta Momentum Human Rig) yang memisahkan struktur tulang dan jaringan tubuh, sehingga lebih interpretatif.

Model ini bisa dikendalikan melalui prompt seperti mask atau keypoint, membuat hasil 3D lebih fleksibel.

Data latih meliputi:

  • Miliar gambar
  • Video multi-kamera berkualitas tinggi
  • Data sintetis profesional
  • Mesin data otomatis untuk memilih pose langka

Dataset akhirnya mencapai sekitar 8 juta sampel berkualitas tinggi.

Model ini unggul dalam banyak benchmark, namun belum mendukung interaksi multi-orang dan presisi pose tangan yang sangat tinggi.


🎨 03. SAM 3: Segmentasi Gambar Naik Kelas ke Tingkat “Pemahaman Konsep”

SAM 3 membawa lompatan besar: segmentasi berbasis konsep.

Model ini dapat memahami prompt seperti:

  • “anjing,” “zebra,” “gajah”
  • “hewan” (kategori luas)
  • “orang memakai jaket hitam dan topi putih”
  • “payung bergaris merah”

Untuk mengukur kemampuan ini, Meta merilis benchmark SA-Co yang mencakup konsep jauh lebih luas.

SAM 3 menerima berbagai bentuk prompt:

  • Teks
  • Contoh gambar
  • Prompt visual (mask, box, titik)

Dalam hasil pengujian:

  • Performa meningkat ~100% di SA-Co
  • Lebih disukai 3:1 dibanding OWLv2
  • Tetap unggul di tugas lama seperti SAM 2, LVIS, object counting

SAM 3 juga menggunakan pipeline AI + manusia untuk anotasi data, dengan AI anotator:

  • 4× lebih cepat pada sampel negatif
  • 36% lebih cepat pada sampel positif

⚙️ 04. Open Source + Arsitektur Terpadu + Penerapan Nyata

Meta membuka:

  • Model SAM 3D
  • Checkpoint SAM 3
  • Dataset
  • Kode inferensi
  • Model mesh manusia MHR

SAM 3 menggunakan arsitektur terpadu:

  • Meta Perception Encoder
  • DETR sebagai sistem deteksi
  • Modul memori SAM 2 untuk tracking

Meta sudah menerapkan teknologi ini secara komersial:

Facebook Marketplace kini memiliki fitur “Room View”

Pengguna dapat mencoba furnitur secara virtual sebelum membeli.

接著讀