Lightbits Rilis Inferra untuk Optimalkan Performa GPU dalam Inferensi AI

Business57 Views

Lightbits Labs Ltd. baru saja mengumumkan ketersediaan umum Inferra, sebuah mesin perangkat lunak yang dirancang untuk meningkatkan ekonomi dan performa inferensi kecerdasan buatan. Inferra memindahkan data cache key-value ke luar memori bandwidth tinggi yang terbatas pada graphics processing unit. Perusahaan yang dikenal sebagai pencipta protokol penyimpanan NVMe over TCP ini memposisikan solusinya sebagai cara untuk mengatasi keterbatasan memori pada GPU saat menjalankan beban kerja inferensi skala besar.

Inferra bekerja dengan memindahkan cache key-value yang biasanya disimpan di HBM GPU ke sistem penyimpanan eksternal yang lebih luas. Pendekatan ini memungkinkan GPU memproses lebih banyak permintaan secara bersamaan tanpa terhambat oleh kapasitas memori onboard yang mahal. Dalam praktiknya, data yang sering diakses tetap dekat dengan pemrosesan, sementara data lain ditangani melalui jaringan berkecepatan tinggi.

Latar belakang teknologi ini berakar pada pengalaman Lightbits dalam mengembangkan protokol NVMe over TCP. Protokol tersebut memungkinkan akses penyimpanan berbasis flash dengan latensi rendah melalui jaringan Ethernet standar. Inferra memanfaatkan fondasi yang sama untuk mendukung kebutuhan penyimpanan cache yang sangat spesifik pada inferensi AI, di mana pola akses data bersifat berulang dan memerlukan throughput tinggi.

Dampak potensial dari solusi ini mencakup penurunan biaya operasional pusat data. Dengan mengurangi ketergantungan pada HBM yang mahal, organisasi dapat menjalankan model bahasa besar atau beban kerja inferensi lainnya dengan konfigurasi perangkat keras yang lebih hemat. Selain itu, pendekatan ini mendukung skalabilitas yang lebih baik ketika volume permintaan inferensi meningkat secara signifikan.

Analisis lebih lanjut menunjukkan bahwa Inferra dapat memberikan keuntungan kompetitif bagi penyedia layanan cloud dan perusahaan yang mengelola infrastruktur AI sendiri. Kemampuan untuk memisahkan penyimpanan cache dari GPU membuka peluang untuk menggunakan media penyimpanan yang lebih murah namun tetap responsif, terutama ketika dikombinasikan dengan jaringan berkecepatan tinggi yang sudah umum di lingkungan enterprise.

Secara keseluruhan, peluncuran Inferra mencerminkan tren industri menuju arsitektur yang lebih terdisagregasi untuk beban kerja AI. Alih-alih meningkatkan kapasitas HBM secara terus-menerus, pendekatan ini menawarkan alternatif yang lebih fleksibel dan ekonomis. Lightbits berharap Inferra dapat diadopsi luas oleh pelaku industri yang menghadapi tekanan biaya dan performa dalam penerapan inferensi AI skala besar.