10 年 2026 月,Positron AI 宣布在 C/C-1 轮融资中筹集了 875 百万美元,投后估值为 5 十亿美元。这家位于里诺的公司正在开发用于推理的芯片和系统,它们不使用惯常的高性能 HBM 内存,而是采用来自智能手机的普通 LPDDR5X。
Positron 的核心技术论点是,传统加速器仅利用了不到 30 % 的 HBM 带宽,而他们的架构能够利用超过 90 % 的 LPDDR5X 带宽。据该公司称,这弥补了峰值性能上的差距,并降低了对稀缺的 HBM 供应链和先进 CoWoS 封装的依赖。
下一代芯片 Asimov 计划于 2026 年底在 TSMC N3P 工艺上流片,并于 2027 年下半年投产。每颗晶粒可承载从 288 GB 到 2,3 TB 的 LPDDR5X。Titan 系统将整合四到八颗此类芯片,目标是在单个节点上支持超过 16 万亿参数的模型,上下文长度超过 10 百万 token。目前,已有超过 50 个第一代平台 Atlas 的机架部署在 Oracle Cloud Infrastructure 中。
在架构上,Positron 押注于紧耦合内存的脉动阵列,从而最大限度地减少数据搬运。与内存和计算分离的经典 GPU 不同,这里的重点转向了容量和带宽的实际利用率。这种方法对于长上下文和大模型尤为适用,因为其瓶颈往往在于内存,而非峰值 FLOPS。
在方法论上,Positron 的声明目前仍基于内部测量以及与 HBM 系统典型指标的对比。公开来源中尚无独立基准测试或详细的测试协议说明。该公司强调其在每美元和每瓦 token 数上的优势,但如果没有公开的第三方测试,就很难评估在实际工作负载中的真实提升。
在推理芯片的格局中,Positron 将自己与深度依赖 HBM 的 Nvidia 和 AMD 的主导方案对立起来。与此同时,其他初创公司和超大规模厂商也在尝试替代方案——从光学互连到定制 ASIC。选择 LPDDR5X 使 Positron 与一些试图绕开先进内存制裁限制的中国开发者的思路相近,但在本例中,重点在于利用率和成本,而不仅仅是可获得性。
如果该架构确实能实现所宣称的带宽利用率,这可能大幅降低超大型模型和长上下文推理的总拥有成本。将有可能更快地扩展集群,而无需争夺有限的 HBM 和 CoWoS 产能。与此同时,成功与否取决于软件和编译器在实际场景中能多有效地加载脉动阵列。
在 Asimov 流片后,独立测试是否会证实 Positron 的优势,以及该系统在扩展到数千个节点时表现如何,这些问题仍悬而未决。该领域接下来值得关注的发布,很可能会在相同模型上比较 Titan 与当前 HBM 方案的实际能效和延迟。
Positron 表明,重新思考优先级——以内存容量和利用率取代峰值带宽——可能成为推理硬件竞赛中真正的替代方案。


