燧原科技于Hot Chips大会详解邃思芯片架构-EDN 电子技术设计

 燧原科技在Hot Chips大会上由首席架构师刘彦和资深芯片设计总监冯闯一起介绍了第一代云端训练芯片“邃思1.0”的架构细节。

2021年8月25日，中国上海——今天燧原科技在一年一度的Hot Chips大会上由首席架构师刘彦和资深芯片设计总监冯闯一起介绍了第一代云端训练芯片“邃思1.0”的架构细节。Hot Chips是全球高性能微处理器和集成电路相关的重要会议之一，芯片行业巨头每年都借此机会展示自己公司的最新成果，包括处理器体系结构，基础架构计算平台，内存处理等各类技术。C59ednc

C59ednc

燧原科技第一代通用人工智能训练芯片“邃思1.0”封装示意图C59ednc

邃思1.0是燧原科技2019年12月发布的第一代云端AI训练芯片，采用众核结构，其计算核心采用了燧原科技自研的GCU-CARE计算引擎。整个SOC拥有32个GCU-CARE计算引擎，组成4个计算群组，全面支持常见AI张量数据格式（FP32/FP16/BF16, INT8/INT16/INT32），更全面地支撑客户业务。CARE还创新地通过复用张量核心，用最有效的晶体管效率提供了标量、向量、张量以及多种数据精度的计算能力。C59ednc

GCU-DARE数据架构，面向数据流优化，在数据流动中进行处理。512GB/s的HBM和200GB/s的GCU-LARE互联，数倍于传统GPU、CPU；强劲的分布式片上共享缓存，提供10TB/s的超大带宽；可编程共享缓存，可控线程内、线程间数据常驻共享，消除不必要的IO访问，既降低了数据访问延时，又节约了宝贵的IO带宽；同时，DARE架构还提供数据异步加载接口，支持数据与运算的流水执行，提高运算并行度。C59ednc

四路 GCU-LARE智能互联，200GB/s的高速低延时片间互联接口，灵活支持不同规模的计算需求，可支持千卡级规模集群，为大中小型数据中心提供基于不同需求的人工智能训练产品组合。C59ednc

C59ednc

“邃思1.0”SOCC59ednc

邃思1.0人工智能加速芯片专为云端训练场景设计，支持CNN、RNN、LSTM、BERT等常用人工训练模型，可用于图像、流数据、语音等训练场景。采用标准PCIe 4.0接口，广泛兼容主流AI服务器，可满足数据中心大规模部署的需求，且能效比领先。C59ednc

演讲的最后部分，刘彦还介绍了上个月刚刚在世界人工智能大会上发布的“邃思2.0”训练芯片。经过全新升级迭代后，邃思2.0的计算能力、存储和带宽、互联能力较第一代训练产品有巨大提升，对超大规模的模型支持能力获得显著增强。由此，燧原科技成为国内首家发布第二代人工智能训练产品组合的公司。C59ednc

邃思2.0进行了大规模的架构升级，针对人工智能计算的特性进行深度优化，夯实了支持通用异构计算的基础；支持全面的计算精度，涵盖从FP32、TF32、FP16、BF16到INT8，单精度FP32峰值算力达到40 TFLOPS，单精度张量TF32峰值算力达到160 TFLOPS。同时搭载了4颗HBM2E片上存储芯片，高配支持64 GB内存，带宽达1.8 TB/s。GCU-LARE也全面升级，提供双向300 GB/s互联带宽，支持数千张云燧CloudBlazer加速卡互联，实现优异的线性加速比。C59ednc

C59ednc

燧原科技第二代通用人工智能训练芯片“邃思2.0”C59ednc

而同步升级的驭算TopsRider软件平台，成为燧原科技构建原始创新软件生态的基石。通过软硬件协同架构设计，充分发挥邃思2.0的性能；基于算子泛化技术及图优化策略，支持主流深度学习框架下的各类模型训练；利用Horovod分布式训练框架与GCU-LARE互联技术相互配合，为超大规模集群的高效运行提供解决方案。开放升级的编程模型和可扩展的算子接口，为客户模型的优化提供了自定义的开发能力。C59ednc

关于燧原科技C59ednc

燧原科技专注人工智能领域云端算力平台，致力为人工智能产业发展提供普惠的基础设施解决方案，提供自主知识产权的高算力、高能效比、可编程的通用人工智能训练和推理产品。其创新性架构、互联方案和分布式计算及编程平台，可广泛应用于云数据中心、超算中心、互联网、金融及政务等多个人工智能场景。C59ednc

燧原科技携手业内国际标准组织，秉承开源开放的宗旨，与产业伙伴一起促进人工智能产业发展。C59ednc

阅读全文，请先

人工智能处理器/DSP 缓存/存储技术新品

上一篇： VisIC推出最高效的氮化镓7.2kW双向图腾柱PFC参考设计 下一篇： Rambus推出支持HBM3的内存子系统，速率可达8.4Gbps，助力AI/ML性能提升

微信扫一扫
一键转发
最前沿的电子设计资讯
请关注“电子技术设计微信公众号”

2025松山湖中国IC创新高峰论坛：继续聊聊机器人去年的主题是智慧机器人，今年的主题仍然聚焦于机器人身上，不过变为了具身智慧机器人……
鹏瞰TS-PON Gen2芯片，用光协议重塑机器人“神经网络” TS-PON Gen2芯片是一款灵活的软件定义 SoC，适用于多种场景。它基于无源光网（PON）技术，具备高带宽（目前10G，未来可拓展至25G、50G）、低时延（微秒级）、高确定性等特性···
让人形机器人“耳聪目明”，昆泰芯KTM5900磁性编码器解编码器芯片作为机器人的核心传感器之一，对于提升机器人的感知能力、安全性和生产效率具有重要意义···
如何让具身机器人“看”得清？思特威给出了这个答案相比于滚动快门传感器，全局快门传感器能够同时曝光整个画面，有效避免了运动过程中产生的图像形变，为机器视觉提供高精度、无畸变的图像···
极海推出全球首款双核Cortex-M52实时控制MCU/DSP 随着机器人技术的不断发展，其应用领域从传统的工业制造逐步拓展至医疗、农业等多个新兴领域，这对机器人的控制系统提出了更高的要求，当前机器人控制系统当前主要面临高爆发、高动态、高精度和高安全这四方面的挑战···
比人类更灵活？先楫HPM6E8Y机器人关节控制解决方案 HPM6E8Y通过硬件加速器将电机控制算法执行时间缩短至2.8μs，以全链路高实时通信与多轴协同能力，开启机器人关节“芯”时代。
为旌科技感算控一体化芯片落地，带来6倍效率提升？具身智能的本质是‘大脑（认知）+小脑（控制）+感官（感知）’的协同进化，需要芯片层面实现三者深度融合。
爱芯元智发布AX8850：让AI算力更便宜，让智能更可及爱芯元智希望把算力做得更加便宜具智价比，普惠AI，让我们的边缘智能更加触手可及···
万有引力EB100芯片亮相，空间计算走向低功耗新时代？ EB100芯片将为XR和机器人行业带来更好、更低功耗的空间计算和显示能力，开启空间计算时代的无限可能···
芯驰D9 Max：为具身智能而生的高性能SoC，一颗芯片顶五颗我们希望以1个芯片完成5个芯片完成的事情。当应用发生爆炸性的变化，融合一定是一个非常大的趋势，而且融合的过程会使软件的开发更简单，系统的开发更简单，成本控制得更好···
情境感知AI：利用FPGA技术增强边缘智能现场可编程门阵列（FPGA）的灵活性、现场升级能力和互操作性，结合其低功耗、低延迟和并行处理能力，使其成为开发者克服挑战并优化情境边缘AI应用的关键工具。
ADAS 系统中的传感器创新如何在道路交通中挽救生命在本文中，我们将探讨 ADAS 在提高道路安全方面的作用，以及各种对实现这一目标至关重要的传感器技术。

热门评论
最新评论

换一换

杂志声明

燧原科技于Hot Chips大会详解邃思芯片架构