Lengan C1: Ini adalah teras baharu yang meningkatkan prestasi dan AI.

  • Keluarga teras Arm C1 baharu (Ultra, Premium, Pro dan Nano) dengan sehingga 45% lebih prestasi berbilang teras.
  • SME2 meningkatkan AI pada CPU: purata peningkatan sebanyak 3,7x dan sehingga 5x di bawah beban tertentu, dengan penggunaan kuasa yang lebih rendah.
  • C1-DSU membenarkan kelompok sehingga 14 teras, L3 dikongsi dan konfigurasi yang sangat fleksibel.
  • Platform CSS Lumex: Penyepaduan CPU C1, GPU Mali G1 dan sokongan untuk LPDDR6 3nm.

Teras lengan C1

Keluarga baru dari Teras lengan C1 menandakan perubahan besar dalam ekosistem peranti mudah alih dan ultraportable, menggantikan Cortex yang biasa dengan tumpuan yang lebih jelas pada prestasi dan kecekapan yang mampan. Generasi ini datang dengan Platform Lumex dan dengan objektif yang jelas: untuk mempercepatkan AI pada peranti itu sendiri tanpa menjejaskan bateri atau suhu.

Di sebalik pertukaran nama, cadangan itu digabungkan Seni bina Armv9.3-A, reka bentuk semula subsistem memori yang mendalam, dan peningkatan ketara kepada keupayaan pengkomputeran matriks. Hasilnya ialah peningkatan prestasi yang meluas dengan penggunaan kuasa yang lebih rendah, serta peta jalan yang direka untuk telefon pintar, tablet, komputer riba dan boleh pakai.

Seni bina dan ciri baharu teras Arm C1

Seni bina teras lengan C1

Siri C1 disusun kepada empat varian: C1-Ultra (prestasi maksimum), C1-Premium (prestasi tinggi di kawasan yang kurang), C1-Pro (imbangan) dan C1-Nano (kecekapan maksimum). Setiap pengeluar boleh menggabungkan blok ini dalam kelompok heterogen untuk mencipta SoC yang disesuaikan dengan julat dan kegunaan yang berbeza, dengan konfigurasi hingga 14 teras.

Arm telah mengubahsuai kedua-dua bahagian hadapan dan belakang, termasuk penambahbaikan pada ramalan, cache dan pelaksanaan yang tidak tertib. Terima kasih kepada sambungan baharu dan cache kongsi yang lebih cekap (intensif data), sel SLC), platform ini menawarkan peningkatan purata hampir 15% dalam penggunaan harian, yang berskala kepada +30% pada beban yang menuntut dan mencapai puncak sehingga 45% dalam multicore.

Sokongan memori berkembang dengan LPDDR6 untuk mengurangkan penggunaan kuasa dan kependaman, sambil mengekalkan keserasian dengan LPDDR5X pada kelajuan sehingga 9600 MT/s. Pangkalan memori ini, bersama-sama dengan reka bentuk semula kluster, mengukuhkan prestasi dan tindak balas yang berterusan di bawah tekanan haba.

C1-Ultra: siling prestasi

Sebagai teras teratas, C1-Ultra Ia menyasarkan SoC perdana dan tugas permintaan tinggi seperti fotografi pengiraan, model AI besar atau permainan AAA mudah alih. Berbanding dengan Cortex-X925, Arm bercakap tentang a +25% dalam satu utas, angka yang membantu menskalakan prestasi keseluruhan apabila digabungkan dengan lebih banyak teras dalam kelompok.

Bahagian hadapan meningkatkan lebar jalur L1 arahan dan ketepatan ramalan, manakala bahagian belakang meningkatkan tetingkap pelaksanaan tertib sebanyak kira-kira 25%, menjangkau sekitar 2.000 arahan serentak. Di samping itu, kapasiti data L1 digandakan kepada 128 KB dan kelajuan bacaan L1 dipercepatkan kira-kira 33%.

C1-Premium: prestasi tinggi di kawasan yang kurang

Untuk peranti premium yang tidak memerlukan maksimum mutlak, C1-Premium mengekalkan seni bina yang sangat dekat dengan Ultra tetapi dengan a 35% pengurangan kawasanIa direka bentuk untuk mengimbangi prestasi dan kos, memudahkan reka bentuk yang lebih padat tanpa mengorbankan angka penting.

C1-Pro: Imbangan dan Otot Berbilang Teras

Di bahagian tengah, C1-Pro menggantikan Cortex‑A725 dengan a +11% kecekapan pada penggunaan yang sama dan dengan peningkatan kecekapan yang mencapai sehingga 26% kurang tenaga pada prestasi yang samaDalam permainan, Arm memetik keuntungan sekitar + 16% dalam kelas nukleus ini.

Kekunci berada dalam bahagian hadapan yang lebih berkebolehan (ramalan statik yang diperhalusi dan a BTB yang lebih besar), dan bahagian belakang dengan lebih lebar jalur dalam L1D dan kependaman yang lebih rendah dalam L2 apabila ramalan adalah betul. Peramal juga telah ditala untuk mempercepatkan tindak balas dalam senario dunia sebenar.

C1-Nano: kecekapan di atas segalanya

Untuk tugas ringan dan penjimatan melampau, C1-Nano meningkatkan kecekapan di sekeliling 26% berbanding dengan pendahulunya (menjaga kawasan itu hampir utuh, ~+2% berbanding A520). Peringkat ramalan dan pengambilan telah dipisahkan untuk membawa arahan ke L1 lebih awal dan mengurangkan penantian untuk ramalan yang gagal.

Selain itu, pemprosesan vektor, pemacu dimatikan apabila saluran paip tersekat dan trafik antara L3 dan DRAM dikurangkan (sekitar 21% secara purata dan sehingga 39% di bawah beban tertentu), yang mengurangkan penggunaan dan meningkatkan tindak balas.

C1-DSU: Kelompok fleksibel dan penggunaan yang lebih rendah

Baru C1-DSU mengatur sambungan teras di bawah cache L3 yang dikongsi dan merapatkan jurang dengan seluruh SoC (RAM, GPU, dll.). Berbanding dengan lelaran sebelumnya, reka bentuk mengurangkan penggunaan kuasa sistem biasa oleh sekitar 11% dan kesan ingatan sebanyak ~7%, bergantung pada mod seperti L3 Tidur Cepat untuk meminimumkan kerugian apabila tidak digunakan.

Satu lagi bahagian penting ialah penyepaduan Pemecut SME2 sebagai elemen luar teras: dalam C1-Ultra dan C1-Premium kehadirannya adalah wajib, manakala dalam C1-Pro dan C1-Nano Ia adalah pilihan bergantung pada reka bentuk pengeluar. Mana-mana teras dalam gugusan boleh mengaksesnya apabila ada, mendayakan gabungan yang sangat pelbagai (cth., 2× C1‑Ultra + 6× C1‑Pro dengan satu atau dua pemecut SME2, ​​atau kombinasi yang lebih sederhana mencampurkan Pro dan Nano).

Platform Lumex juga termasuk generasi baru GPU. Walaupun tumpuan berita ini adalah pada CPU, tetapi Mali G1 disertai dengan ~20% peningkatan dalam prestasi grafik, menggandakan daya tampung pengesanan sinar dan mengurangkan kos kuasa setiap bingkai sebanyak kira-kira 9%, mengukuhkan gabungan untuk permainan yang mengutamakan GPU dan beban kerja AI.

SME2 dan peranan CPU dalam AI

SME2 pada Lengan C1

Lompatan besar dalam AI datang dengan SME2 (Sambungan Matriks Boleh Skala 2), yang mempercepatkan pendaraban matriks, berbilang predikat dan jenis data baharu (termasuk ketepatan padat seperti 2b/4b), dan menyelaras dengan SVE2 untuk pengvektoran lanjutan. Dalam nombor agregat, Arm bercakap tentang peningkatan purata sebanyak 3,7x dengan penggunaan menurun hampir dengan 27%.

Dalam kes praktikal, syarikat telah menunjukkan pengurangan kependaman sebanyak 4,7x dalam pengecaman pertuturan (Pangkalan Bisikan), 2,4–2,8x kelajuan masuk teks ke ucapan dan peningkatan besar dalam penjanaan token untuk LLM (cth. Gemma 3) yang hampir dengan × 5Berjalan pada CPU mengelakkan pemindahan ke pemecut lain, yang mengurangkan masa menunggu dan memberikan responsif.

Untuk beban kecil atau interaktif, CPU mengambil bahagian tengah sekali lagi: dengan PKS2Banyak tugasan harian (peningkatan imej tempatan, pembahagian, pengelasan, kesan kamera atau audio) diselesaikan dengan lebih cepat, dengan kurang overhed dan tanpa melalui rangkaian. Apabila permintaan meningkat, GPU atau NPU luaran boleh terus mengambil alih, tetapi CPU tidak lagi menjadi halangan.

Sokongan perisian juga tersedia: terdapat integrasi dalam Linux dan Android 16, rantai alat dan perpustakaan yang dioptimumkan (KleidiAI), dan keserasian dengan enjin seperti Perpaduan dan Enjin Tidak SebenarIni akan memudahkan apl dan permainan menggunakan penambahbaikan ini dengan pantas apabila SoC komersial pertama tiba.

Platform itu CSS Lumex meletakkan semua bahagian bersama-sama (C1 CPU, Mali G1 GPU, interconnect dan memori) dengan reka bentuk sedia pengeluaran 3 nm, telemetri perkakasan dan Keserasian sistem lengan dengan LPDDR6. Ini membolehkan rakan kongsi mempercepatkan projek mudah alih dan komputer riba mereka dengan kluster boleh skala sehingga 14 teras dan keupayaan AI pada peranti.

Arm C1 bergabung prestasi yang berterusan, kecekapan dan dorongan sebenar untuk AI pada CPU terima kasih kepada SME2; mereka menawarkan fleksibiliti C1-DSU untuk menyesuaikan kluster kepada setiap rangkaian produk dan membentuk asas yang kukuh untuk gelombang seterusnya SoC mudah alih dan mudah alih yang berusaha mengimbangi kuasa, autonomi dan keupayaan AI tanpa sentiasa bergantung pada awan.

RISC-V SoC Sophgo
Artikel berkaitan:
SOPHGO SG2000/SG2002: SoC untuk AI dengan teras RISC-V + ARM

Tambahkan sebagai sumber pilihan dalam Google