Cerebras发布了其新一代Nexus机架级平台架构的首款产品CS-4加速器。该产品的核心技术特点在于采用了系统级晶圆(SoW)封装,并基于台积电5纳米制程打造,最大亮点是摒弃了对高带宽存储器的依赖,转而使用SRAM进行替代。
从部署和工程角度看,CS-4加速器具备可插拔的背包式设计。这一集成化设计将电源转换、液冷系统以及控制电子元件整合于一体,极大地优化了现场部署流程,据报道,该设计的应用可以将原本需要数天才能完成的部署时间缩短至数小时。
在性能指标方面,CS-4提供了750 PFLOPs的AI算力、每秒129.6 PB的内存带宽以及每秒7.2 Tbps的I/O吞吐量。此外,单个机柜可以容纳3颗晶圆,而整个系统支持超过50万亿参数的模型,其总功耗(TDP)预计在125至135kW之间。
性能的实际体现体现在模型推理测试中。在对GPT-OSS-120B模型的测试结果显示,CS-4每用户每秒可生成超过4400个Token,这一速度最高达到了现有GPU方案的30倍。
从架构设计的角度看,Cerebras的系统级晶圆(SoW)封装是其关键差异点。这种设计允许公司构建出高度集成的计算平台,使得CS-4加速器能够直接在机架级别提供强大的算力支持。
考虑到客户需求的多样性,Cerebras还与亚马逊AWS和AMD进行了合作,该合作机制允许客户将计算密集度极高的预填充阶段外包给AMD Instinct GPU,为用户提供了灵活的异构计算能力选择。
时间线回顾显示,CS-4加速器作为新一代Nexus机架级平台架构的首款产品发布,标志着Cerebras在高性能AI计算硬件领域推进了其系统级的解决方案。这种从底层晶圆封装到上层机柜集成的完整链条展示了公司对数据中心算力部署的深度优化。
影响分析方面,CS-4加速器通过集成化设计和高密度封装,旨在解决当前大型AI模型训练和推理过程中面临的系统集成复杂度和部署周期过长等行业痛点。其性能指标的公布,直接将Cerebras置于与主流GPU方案进行算力对比的焦点位置。
需要强调的是,所有关于CS-4加速器的具体技术参数、性能测试结果以及架构描述均来源于一份公开资料,用户应了解这些信息是基于该单一来源的报道。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。