Positron rzuca wyzwanie HBM: jak chipy na zwykłej pamięci LPDDR5X mogą zmienić ekonomikę wnioskowania AI

Edytowane przez: Svitlana Velhush

10 września 2026 roku Positron AI ogłosiła pozyskanie 875 mln dolarów w rundzie Series C/C-1 przy wycenie post-money wynoszącej 5 mld dolarów. Firma z Reno opracowuje chipy i systemy do wnioskowania, które zamiast typowej pamięci wysokiej wydajności HBM wykorzystują zwykłą LPDDR5X ze smartfonów.

Kluczowa teza techniczna Positron sprowadza się do tego, że tradycyjne akceleratory wykorzystują mniej niż 30 % przepustowości HBM, podczas gdy ich architektura pozwala wykorzystać ponad 90 % bandwidth LPDDR5X. Zdaniem firmy rekompensuje to różnicę w wydajności szczytowej i zmniejsza zależność od deficytowych łańcuchów dostaw HBM oraz zaawansowanego pakowania CoWoS.

Kolejny chip Asimov ma zostać wprowadzony na TSMC N3P pod koniec 2026 roku, z produkcją w drugiej połowie 2027-go. Każdy kryształ będzie mógł pomieścić od 288 GB do 2,3 TB LPDDR5X. System Titan połączy cztery do ośmiu takich chipów i jest ukierunkowany na modele powyżej 16 bln parametrów z kontekstem ponad 10 mln tokenów w jednym węźle. Już teraz ponad 50 stojaków pierwszej platformy Atlas jest wdrożonych w Oracle Cloud Infrastructure.

Architektonicznie Positron stawia na systolic array ze ściśle zintegrowaną pamięcią, co pozwala zminimalizować przemieszczanie danych. W przeciwieństwie do klasycznych GPU, gdzie pamięć i obliczenia są rozdzielone, tutaj akcent przesuwa się na pojemność i realne wykorzystanie bandwidth. Takie podejście jest szczególnie aktualne w przypadku modeli długokontekstowych i dużych, gdzie wąskim gardłem jest często właśnie pamięć, a nie szczytowy FLOPS.

Metodologicznie twierdzenia Positron opierają się na razie na wewnętrznych pomiarach i porównaniach z typowymi wskaźnikami systemów HBM. Niezależnych benchmarków ani szczegółowych opisów protokołów testowania w otwartych źródłach na razie nie ma. Firma podkreśla przewagi pod względem tokenów na dolara i na wat, jednak bez publicznych testów third-party trudno ocenić realny przyrost w rzeczywistych workload.

W krajobrazie chipów do wnioskowania Positron przeciwstawia się dominującym rozwiązaniom Nvidia i AMD, które są ściśle związane z HBM. Równolegle inne startupy i hiperskalerzy eksperymentują z alternatywnymi podejściami — od optycznych interconnect po custom ASIC. Wybór LPDDR5X zbliża Positron do idei niektórych chińskich deweloperów, dążących do obejścia sankcyjnych ograniczeń na zaawansowaną pamięć, ale w tym przypadku akcent położono na wykorzystanie i koszt, a nie tylko na dostępność.

Jeśli architektura rzeczywiście zapewni deklarowane wykorzystanie bandwidth, może to istotnie obniżyć TCO wnioskowania dla bardzo dużych modeli i długich kontekstów. Pojawi się możliwość szybszego skalowania klastrów bez walki o ograniczone wolumeny HBM i CoWoS. Jednocześnie sukces zależy od tego, jak efektywnie oprogramowanie i kompilator będą w stanie obciążać systolic array w rzeczywistych scenariuszach.

Otwarte pozostaje pytanie, czy niezależne testy potwierdzą przewagi Positron po tape-out Asimova i jak system zachowa się przy skalowaniu do tysięcy węzłów. Kolejne ciekawe publikacje w tej dziedzinie będą prawdopodobnie porównywać rzeczywistą efektywność energetyczną i latency Titan z aktualnymi rozwiązaniami HBM na identycznych modelach.

Positron pokazuje, że przewartościowanie priorytetów — pojemność i wykorzystanie pamięci zamiast szczytowej przepustowości — może stać się realną alternatywą w wyścigu sprzętu do wnioskowania.

1 Wyświetlenia

Źródła

  • Positron Raises $875M for Memory-First Inference Chips

Komentarze

Czytaj więcej artykułów na ten temat:

Czy znalazłeś błąd lub niedokładność?Rozważymy Twoje uwagi tak szybko, jak to możliwe.