Pernahkah Anda mendengar paradoks Moravec? Paradoks menyatakan bahwa penalaran lanjutan membutuhkan kekuatan komputasi yang sangat sedikit untuk sistem kecerdasan buatan (AI), sambil menerapkan keterampilan motorik perseptual yang diterima manusia membutuhkan sumber daya komputasi yang sangat besar. Intinya, tugas -tugas logis yang kompleks lebih mudah untuk AI daripada tugas -tugas sensorik dasar yang dapat dicapai oleh naluri manusia. Paradoks ini menyoroti perbedaan antara AI dan kemampuan kognitif manusia pada tahap ini.
Orang pada dasarnya multimoda. Masing -masing dari kita seperti terminal cerdas yang biasanya perlu pergi ke sekolah untuk dididik (dilatih), tetapi tujuan dan hasil dari pelatihan dan pembelajaran itu adalah bahwa kita memiliki kemampuan untuk bekerja dan hidup secara mandiri tanpa selalu mengandalkan instruksi eksternal dan kontrol.
Kita belajar tentang dunia di sekitar kita melalui berbagai modalitas sensorik seperti penglihatan, ucapan, suara, sentuhan, rasa, dan bau untuk menganalisis, bernalar, memutuskan, dan mengambil tindakan.
Setelah bertahun -tahun fusi sensor dan evolusi AI, robot sebagian besar dilengkapi dengan sensor multimodal pada tahap ini. Saat kami membawa lebih banyak kekuatan komputasi ke perangkat seperti robot, perangkat ini menjadi lebih pintar dan lebih pintar, mampu merasakan lingkungan mereka, memahami dan berkomunikasi dalam bahasa alami, memperoleh haptics melalui antarmuka penginderaan digital, serta penginderaan kekuatan spesifik robot, robot, robot tersebut, Kecepatan sudut, dan bahkan medan magnet di sekitar robot melalui kombinasi akselerometer, giroskop & magnetometer, dan banyak lagi.
Menuju era baru robotika dan kognisi mesin
Sebelum transformator dan model bahasa besar (LLM), menerapkan multimodality dalam AI biasanya membutuhkan penggunaan beberapa model terpisah yang bertanggung jawab untuk berbagai jenis data (teks, gambar, audio) dan integrasi modalitas yang berbeda melalui proses yang kompleks.
Dengan munculnya model transformator dan LLM, multimodality telah menjadi lebih terintegrasi, memungkinkan model tunggal untuk secara bersamaan memproses dan memahami banyak tipe data, menghasilkan sistem AI yang lebih mampu merasakan secara komprehensif merasakan lingkungan mereka. Pergeseran ini telah sangat meningkatkan efisiensi dan efektivitas aplikasi AI multimodal.
Sementara LLMS seperti GPT -3 terutama berbasis teks, industri ini telah membuat kemajuan cepat menuju multimodality. Dari klip Openai dan Dall-E, dan sekarang Sora dan GPT -4 O, adalah contoh model yang telah bergerak ke arah multimodality dan interaksi manusia-komputer yang lebih alami. Misalnya, klip memahami gambar yang dipasangkan dengan bahasa alami, sehingga menjembatani kesenjangan antara informasi visual dan tekstual; Dall-E bertujuan untuk menghasilkan gambar berdasarkan deskripsi tekstual. Kami melihat model Google Gemini mengalami evolusi yang sama.
Pada tahun 2024, evolusi multimodal berakselerasi. Pada bulan Februari, Openai merilis Sora, yang menghasilkan video realistis atau imajinatif berdasarkan deskripsi teks. Ketika Anda memikirkannya, ini dapat memberikan jalan yang menjanjikan untuk membangun simulator dunia universal, atau menjadi alat penting untuk pelatihan robot. Setelah tiga bulan, GPT -4 O telah secara signifikan meningkatkan kinerja interaksi manusia-robot dan mampu bernalar secara real time antara audio, visi dan teks. Menggabungkan informasi teks, visual dan audio untuk melatih model baru end-to-end menghilangkan dua transisi modal dari modalitas input ke teks dan kemudian dari teks ke modalitas output, yang pada gilirannya secara dramatis meningkatkan kinerja.
Pada minggu yang sama di bulan Februari, Google merilis Gemini 1.5, yang secara dramatis memperluas panjang konteks menjadi 1 juta token. Ini berarti bahwa 1,5 Pro dapat memproses sejumlah besar informasi sekaligus, termasuk satu jam video, 11 jam audio, dan basis kode yang berisi lebih dari 30, 000 baris kode atau 700, 000 Words.gemini 1.5 dibangun di atas penelitian terkemuka Google tentang transformator dan arsitektur ahli beranggotakan campuran (MOE), dan model open-source 2B dan 7B yang dapat digunakan di tepi samping. Pada konferensi Google I/O pada bulan Mei, selain menggandakan panjang konteks dan merilis serangkaian alat dan aplikasi AI generatif, Google mengeksplorasi visinya untuk masa depan Project Astra, asisten AI tujuan umum yang memproses informasi multimodal umum , memahami konteks di mana pengguna ditempatkan, dan berinteraksi dengan orang -orang dalam percakapan dengan cara yang sangat alami.
Sebagai perusahaan di belakang LLM Llama Sumber Terbuka, Meta juga bergabung dengan trek Kecerdasan Buatan Umum (AGI).
Multimodalitas sejati ini sangat meningkatkan tingkat kecerdasan mesin dan akan mengarah pada paradigma baru untuk banyak industri.
Sebagai contoh, robot dulunya sangat homogen, dengan beberapa sensor dan kemampuan penggerak, tetapi umumnya mereka tidak memiliki "otak" untuk mempelajari hal -hal baru dan beradaptasi dengan lingkungan yang tidak terstruktur dan tidak dikenal.
LLM multimodal diharapkan untuk mengubah kemampuan robot untuk menganalisis, bernalar, dan belajar, memindahkannya dari spesialisasi ke generalisasi. PC, server, dan smartphone adalah pemimpin di platform komputasi tujuan umum, dan dapat menjalankan berbagai jenis aplikasi perangkat lunak untuk mencapai berbagai fungsi. Generalisasi akan membantu meningkatkan, menghasilkan skala ekonomi, dan harga dapat dikurangi secara dramatis saat ditingkatkan, yang mengarah ke siklus adopsi yang baik di lebih banyak bidang.
Elon Musk memperhatikan manfaat dari teknologi umum sejak awal, ketika robot Tesla berevolusi dari Bumblebee pada tahun 2022 menjadi Optimus Gen 1, diumumkan pada Maret 2023, dan Gen 2, diumumkan pada akhir 2023, dengan fleksibilitas dan kemampuan belajar yang terus meningkat. Selama bulan lalu 6-12 bulan, kami telah menyaksikan sejumlah terobosan di bidang robotika dan robotika humanoid.
Teknologi baru di balik robotika generasi berikutnya dan kecerdasan yang diwujudkan
Tidak ada keraguan bahwa kita masih memiliki banyak pekerjaan yang harus dilakukan sebelum kecerdasan yang diwujudkan mencapai produksi massal. Kami membutuhkan desain yang lebih ringan, runtime yang lebih lama, dan platform komputasi tepi yang lebih cepat dan lebih kuat untuk memproses dan menyatu informasi data sensor untuk membuat keputusan tepat waktu dan tindakan mengendalikan.
Dan kami bergerak menuju menciptakan robot humanoid; Ribuan tahun peradaban manusia telah menghasilkan lingkungan di mana-mana yang dirancang untuk manusia, dan sistem robot humanoid diharapkan dapat berinteraksi dengan nyaman dengan manusia dan lingkungan dan melakukan operasi yang diperlukan di lingkungan yang ada manusia karena kesamaan mereka dalam bentuk orang. Sistem ini akan sangat cocok untuk menangani tugas yang kotor, berbahaya, dan membosankan seperti perawatan dan rehabilitasi pasien, pekerjaan layanan di industri perhotelan, alat bantu pengajaran atau teman belajar di bidang pendidikan, dan tugas -tugas berbahaya seperti respons bencana dan penanganan bahan berbahaya yang berbahaya . Aplikasi semacam itu menggunakan atribut manusia mesin humanoid untuk memfasilitasi interaksi manusia-robot alami, bertindak di ruang yang berpusat pada manusia, dan melakukan tugas yang seringkali sulit untuk dicapai oleh robot tradisional.
Banyak perusahaan AI dan robotika meluncurkan penelitian dan kolaborasi baru seputar cara melatih robot dengan alasan yang lebih baik dan merencanakan lingkungan baru yang tidak terstruktur. Karena "otak" baru robot, model yang dilatih sebelumnya pada sejumlah besar data memiliki kemampuan generalisasi yang sangat baik, memungkinkan robot untuk melihat dan memahami lingkungan mereka secara lebih komprehensif, menyesuaikan gerakan dan tindakan mereka berdasarkan umpan balik sensorik, dan mengoptimalkan kinerja mereka di berbagai lingkungan yang dinamis.
Sebagai contoh yang menarik, anjing robot Boston Dynamics, Spot, dapat bertindak sebagai pemandu wisata di museum, berinteraksi dengan pengunjung, memperkenalkannya ke berbagai pameran, dan menjawab pertanyaan mereka. Mungkin sulit untuk dipercaya, tetapi dalam kasus penggunaan ini, penampilan Spot yang menghibur, interaktif, dan halus lebih penting daripada memastikan faktanya benar.
Transformator Robotika: Otak Baru Robotika
Robotics Transformer (RT) berkembang pesat untuk menerjemahkan input multimodal secara langsung ke dalam kode yang dapat ditindaklanjuti. RT -2 Google DeepMind melakukan serta pendahulunya, RT -1, dengan tingkat keberhasilan hampir 100% saat melakukan tugas yang telah terlihat sebelumnya. Namun, ketika dilatih dengan Palm-E (model bahasa multimodal yang diwujudkan dengan robot) dan Pali-X (visi multibahasa skala besar dan model bahasa, tidak dirancang khusus untuk robot), RT -2 memiliki kemampuan generalisasi yang lebih baik yang lebih baik generalisasi yang lebih baik lebih baik dan mengungguli rt -1 pada tugas yang tidak terlihat.
Microsoft memperkenalkan LLAVA, bahasa skala besar dan asisten visi. Awalnya dirancang untuk tugas berbasis teks, LLAVA memanfaatkan kekuatan GPT -4 untuk membuat paradigma baru untuk instruksi multimodal untuk mengikuti data, mengintegrasikan komponen tekstual dan visual yang mulus, yang dapat berguna untuk tugas robot. Setelah diperkenalkan, Llava mencatat catatan baru untuk obrolan multimodal dan tugas -tugas kuis ilmiah, sudah melebihi kemampuan rata -rata manusia.
Seperti yang disebutkan sebelumnya, robotika Tesla ke dalam humanoid dan robotika tujuan umum AI adalah signifikan bukan hanya karena dirancang untuk skala dan produksi massal, tetapi juga karena fondasi teknologi yang sepenuhnya dapat diselesaikan dengan diri sendiri (FSD) dari autopilot Tesla untuk mobil dapat digunakan untuk mobil dapat digunakan robot. Tesla juga memiliki case penggunaan manufaktur yang cerdas untuk menerapkan Optimus pada proses produksi kendaraan energi baru.
Lengan adalah landasan masa depan robotika
Arm percaya bahwa otak robot, baik "otak besar" dan "otak kecil," harus menjadi sistem komputasi AI yang heterogen yang memberikan kinerja yang unggul, respons waktu nyata, dan efisiensi energi.

Robotika melibatkan berbagai tugas, termasuk perhitungan dasar (misalnya, mengirim dan menerima sinyal ke dan dari motor), pemrosesan data canggih (misalnya, menafsirkan data gambar dan sensor), dan menjalankan LLM multimoda yang disebutkan sebelumnya. CPU sangat cocok untuk tugas-tugas tujuan umum, sementara pedal gas AI dan GPU dapat lebih efisien menangani tugas pemrosesan paralel, seperti pembelajaran mesin (ML) dan pemrosesan grafis. Pedal gas tambahan seperti prosesor sinyal gambar dan codec video juga dapat diintegrasikan untuk meningkatkan kemampuan penglihatan robot dan efisiensi penyimpanan/transmisi. Selain itu, CPU harus memiliki respons real-time dan perlu dapat menjalankan sistem operasi seperti paket Linux dan ROS.
Ketika diperluas ke tumpukan perangkat lunak robot, lapisan sistem operasi juga mungkin memerlukan sistem operasi real-time (RTOS) yang dapat secara andal menangani tugas-tugas kritis waktu, serta distribusi Linux yang disesuaikan untuk robotika, seperti ROS, yang dapat menyediakan Layanan yang dirancang untuk kelompok komputasi yang heterogen. Kami percaya bahwa standar yang disponsori ARM dan program sertifikasi seperti Systemready dan PSA Certified akan membantu skala pengembangan perangkat lunak robot. Systemready dirancang untuk memastikan bahwa distribusi OS kaya standar berjalan pada berbagai sistem-on-chip (SOC) berdasarkan arsitektur ARM, sementara PSA bersertifikat membantu menyederhanakan solusi implementasi keamanan untuk memenuhi keamanan dan persyaratan peraturan regional untuk perangkat yang terhubung.
Kemajuan dalam model multimodal skala besar dan generatif AI menggembar-gemborkan era baru dalam pengembangan robot AI dan robot humanoid. Seiring dengan komputasi dan ekosistem AI, efisiensi energi, keamanan, dan keselamatan fungsional sangat penting untuk membuat arus utama robotika di era baru ini. Prosesor ARM sudah banyak digunakan dalam robotika, dan kami berharap dapat bekerja sama dengan ekosistem untuk menjadikan ARM sebagai landasan masa depan robotika AI.




