广告

一文看懂特斯拉Dojo的江湖地位及独门秘籍

2021-08-24 胡安 阅读:
近日特斯拉亮相的D1 芯片宣称拥有500亿个晶体管,超过了AMD拥有395.4亿个晶体管的Epyc Rome,落后于NVIDIA的GA100 Ampere SoC的540亿个晶体管的记录。

现在,特斯拉不仅是个汽车公司、AI公司,还是个芯片公司。在AI训练芯片界,用于训练AI模型的芯片供应商,除了英特尔、英伟达和Graphcore,现在还有特斯拉。UU8ednc

近日特斯拉亮相的D1 芯片宣称拥有500亿个晶体管,超过了AMD拥有395.4亿个晶体管的Epyc Rome,落后于NVIDIA的GA100 Ampere SoC的540亿个晶体管的记录。UU8ednc

D1 芯片总共有645mm²,每mm²上集成7750万个晶体管的有效晶体管密度,仅次于移动芯片苹果M1,功率密度高于Nvidia A100 GPU。UU8ednc

UU8ednc

D1使用 7nm工艺,推测是由三星或台积电代工,考虑到三星也制造了特斯拉的HW3芯片,所以前者代工D1的可能性更大一些。UU8ednc

25个D1芯片组成一个Training Tile(训练片,EDN没有看到官方翻译,根据Tile的原意”瓦片”和它的外观暂且译为”训练片”吧);然后12个训练片可以组成一个服务器机柜,共108 PFlops;几个机柜再组成Dojo超级计算机。UU8ednc

UU8ednc

图:每个服务器机柜超过 100,000 个功能单元、400,000 个定制内核和132GB SRAM。UU8ednc

Dojo江湖地位

特斯拉曾经采用NVIDIA GPU构建的超级计算机上过Top10榜单,性能仅略低于中国的太湖之光:UU8ednc

UU8ednc

从排名上看起来Dojo并不是计算能力最强的超级计算机,这是Dojo的设计目的只是针对一项非常具体的任务,即:基于大量360度视频训练神经网络。所有代码都是专门为在此硬件上理想工作而编写的。UU8ednc

相比之下,其他超级计算机的构建都考虑到了灵活性,以便能够适应大量不同的任务。当然,如果真的要在视频训练上一决高下,即使是最强大的 Fugaku (富岳),也很可能是比Dojo慢的。UU8ednc

何况巨大的Fugaku是由256 个机柜组成,Dojo仅由10个机柜组成,因此在尺寸方面Dojo也是最小的超级计算机。UU8ednc

如果特斯拉在Dojo中增加54个机柜Dojo就能超过FugakuUU8ednc

Dojo没有 RAM,没有共享缓存

智能手机和特斯拉的HW3都是有SoC之外的RAM 芯片的。即使是最快的最厉害的硬盘驱动器也做不到和RAM一样的随机存取,无法取代RAM。UU8ednc

理论上,最新的PCIe 4技术只能达到0.5~3GB/s,比消费类计算机标准DDR4 RAM的20~25GB/s差太多,更别提高达50GB/s的下一代 DDR5 RAM。UU8ednc

智能手机和消费电脑通常使用 4-32GB的RAM,专业工作站的RAM甚至可以达到512GB。UU8ednc

那么,如果特斯拉的训练芯片没用RAM,那用的是啥?UU8ednc

它内部是有一个更快的随机内存层,称为缓存。当 SoC/CPU 调用DRAM时,响应时间约为 60纳秒;而L3缓存或片上 SRAM 的响应时间可低至10纳秒。UU8ednc

英特尔目前最大的L3缓存是57MB,IBM的记录是120MB,AMD最强大的处理器有256MB的L3缓存,而特斯拉在 2019 年宣布的 HW3 芯片有 64 MB 的 SRAM。 UU8ednc

UU8ednc

特斯拉的训练节点带有1.25MB的SRAM,354个节点组成的计算阵列,也就是这个SoC算下来就是424.8 MB的缓存,这超过了所有其他处理器。——这有可能都不是L3缓存,而是更快的 L2了。UU8ednc

Dojo处理器之间通信采用定制协议

通常SoC是通过引脚把信号发送到主板上再进行传输,但特斯拉并没有把SoC从晶圆上割下来,而是把留在一片晶圆上的所有SoC连接起来。UU8ednc

新 PCI-e Gen 4 连接的最新 SSD 的理论限制为 64 GB/s,特斯拉的每个连接器能达到900 GB/s的速度,推测是他们定制了自己的连接方式。UU8ednc

  UU8ednc

Dojo采用液体冷却训练 

每个 D1 芯片的功耗仅400 W,25个芯片组成的MCM训练片的功耗为15千瓦。训练片是液体冷却的,据说用了10公斤液体,但特斯拉没说是水冷。 UU8ednc

在Tesla的训练片中,有SoC的一侧与常规处理器一样是暴露着的,可以直接冷却。另一侧被稳压器盖住了,如上图所示。UU8ednc

那么稳压器直接盖在处理器有啥好处?UU8ednc

常见的处理器的电源都是装在处理器旁边的主板上,电流需要通过主板、插座、引脚和SoC;而Dojo训练片的电源可以直接传输到SoC,减少了散发的热量。UU8ednc

最后,看起来特斯拉现在已经掌握着摩尔定律的衣钵,马斯克表示,“We should have Dojo operational next year”。明年值得期待。UU8ednc

  • 结果赔了夫人又折兵,成了全民公敌
  • 只能佩服,因为兔子都在忙大数据卖菜呢~~
本文为EDN电子技术设计 原创文章,禁止转载。请尊重知识产权,违者本司保留追究责任的权利。
  • 微信扫一扫
    一键转发
  • 最前沿的电子设计资讯
    请关注“电子技术设计微信公众号”
  • 嵌入式FPGA IP时代终于来了? 嵌入式FPGA (eFPGA)由于可为AI工作负载提供支持与灵活度,这项业务正开始掀起波澜。如今,在将FPGA功能整合至SoC设计时,eFPGA可让设计者定义FPGA逻辑数、内存以及DSP处理能力...
  • Facebook正独立研发AI芯片,为视频需求自主造芯 据知情人士透露,Facebook正在开发新的机器学习芯片,其中一款AI推理芯片主要用于推荐算法等;另一款则主要进行视频转码任务,提高Facebook用户观看录制和直播视频的质量。如果Facebook成功,其芯片将会在性能有所提升的同时,变得更加便宜。同时,自研芯片还有助于Facebook降低数据中心的碳排放,并减少对英特尔、高通等芯片厂商的依赖。
  • 符合IEPE标准的CbM机器学习赋能平台 在工业应用中,基于振动检测的机器状态监控(CbM)越来越重要。公司寻求优化机械寿命和性能并降低拥有成本,同时有些企业试图围绕此类信息的提供开发新的业务模式。为了准确表示需要监控的机械,必须收集大数据集以确定设备在正常工作模式下和故障情况下的基线工作点。一旦收集到这些数据,便可创建算法或阈值检测例程来为该设备提供正确的分析。
  • 座头鲸基于LoRa的网关式智能产品赋能冷链物流行业物联 座头鲸将LoRa等最新物联网技术,与其在物联网智能硬件、定位导航和数据分析等领域的先进技术与经验相结合,为冷链产业全流程监控提供了端到端解决方案。
  • Microchip推出业界最紧凑的1.6T以太网PHY,可为云数据中 通过转换到112G PAM4接口速率,META-DX2L使路由器、交换机和线卡的带宽翻倍
  • 凌华科技推出边缘视觉分析软件开发套件EVA SDK加速边 EVA SDK助力用户在开发两周内即可完成边缘AI视觉应用概念验证
广告
热门推荐
广告
广告
EE直播间
在线研讨会
广告
广告
面包芯语
广告
向右滑动:上一篇 向左滑动:下一篇 我知道了