จากภาพอ้างอิงเพียงภาพเดียว สู่โลกเสมือน 3D ที่สามารถกำหนดมุมมองของกล้องได้ตามต้องการ นี่คือความสามารถใหม่ที่ World Labs นำมาใส่ใน Atlas โมเดลสร้างโลก AI รุ่นล่าสุด
World Labs บริษัท AI ที่ก่อตั้งโดย Fei-Fei Li และมุ่งพัฒนาเทคโนโลยีประเภท World Model เปิดตัวโมเดลใหม่ชื่อ Atlas สำหรับสร้างโลกเสมือน 3D จากข้อมูลอ้างอิงหลากหลายรูปแบบ โดยหนึ่งในฟีเจอร์สำคัญของเวอร์ชันนี้คือความสามารถในการควบคุมตำแหน่งและมุมมองของกล้อง หรือ Camera Control
tlas เป็นโมเดล AI แบบ Multimodal
ซึ่งหมายถึงสามารถรับข้อมูลได้มากกว่าหนึ่งรูปแบบ ไม่ได้จำกัดอยู่แค่ข้อความ แต่รองรับทั้ง ข้อความ ภาพนิ่ง วิดีโอ และโมเดล 3D ก่อนนำข้อมูลเหล่านี้ไปใช้สร้างเป็นโลกเสมือนในรูปแบบ 3D จุดเด่นของ Atlas อยู่ที่แนวคิดของ World Model ซึ่งเป็นโมเดล AI ที่ไม่ได้เพียงเรียนรู้รูปแบบของข้อมูล แต่พยายามทำความเข้าใจว่าโลกและสิ่งต่าง ๆ รอบตัวควรมีลักษณะอย่างไรในบริบทที่แตกต่างกัน
World Labs ระบุว่า Atlas ได้รับการฝึกฝนจากข้อมูลจำนวนมาก ทำให้โมเดลสามารถเข้าใจ บริบทเชิงพื้นที่ หรือ Spatial Context ได้ ซึ่งเป็นความสามารถสำคัญสำหรับการสร้างโลก 3D เพราะ AI ต้องเข้าใจความสัมพันธ์ระหว่างวัตถุ ตำแหน่ง และพื้นที่ภายในฉาก
ความสามารถดังกล่าวทำให้ Atlas สามารถสร้างโลกเสมือน 3D
จาก ภาพอ้างอิงเพียงภาพเดียว พร้อมสร้างฉากที่มีลักษณะสมจริงและน่าเชื่อถือ โดยไม่ได้หยุดอยู่แค่การสร้างภาพ 2D แต่พยายามเปลี่ยนข้อมูลจากภาพให้กลายเป็นพื้นที่ที่สามารถมองในมิติ 3D ได้
สิ่งที่น่าสนใจอีกอย่างใน Atlas คือ Camera Control ซึ่งเปิดให้ผู้ใช้กำหนดตำแหน่งของกล้องได้ละเอียดมากขึ้น ทำให้การสร้างโลกเสมือนไม่ได้จบเพียงการสร้างฉาก แต่ยังสามารถควบคุมมุมมองของผู้ที่เข้าไปสำรวจโลกนั้นได้ตามต้องการ
การเปิดตัว Atlas จึงสะท้อนทิศทางการพัฒนา AI ของ World Labs ที่มุ่งไปไกลกว่าการสร้างข้อความหรือภาพเพียงอย่างเดียว แต่พยายามให้ AI สามารถทำความเข้าใจโครงสร้างของโลกและนำความเข้าใจดังกล่าวมาใช้สร้างสภาพแวดล้อมเสมือนจริงในรูปแบบ 3D
tags : metallab