向右滑动:上一篇 向左滑动:下一篇 我知道了
广告

阿里发布最强AI芯片:性能“吊打”同行,一块顶十块GPU

时间:2019-09-25 作者:网络整理 阅读:
发布含光800芯片时,张建锋拿出一张芯片展示,称“这个芯片真的非常大”。张建锋表示,“含光800”是阿里平头哥成立后首款正式流片的芯片,并称含光800性能“吊打”同行。

刚刚,在阿里2019云栖大会上,阿里巴巴集团首席技术官兼阿里云智能总裁张建锋发布了阿里的首款AI芯片“含光800”。ZPOednc

这是一款云端AI推理芯片,峰值性能为7.8万IPS(每秒能处理7.8万张照片),峰值能效达到500IPS/W,张建锋表示,这是全球最高性能的AI推理芯片,一块“含光800”相当于10块GPU。ZPOednc

003ednc20190925ZPOednc

据了解,含光800主要应用于视觉场景,已经在阿里巴巴集团内多个场景大规模应用,其它企业可以通过阿里云获得含光NPU的算力。ZPOednc

性能“吊打”同行,一块顶10块GPU

发布含光800芯片时,张建锋拿出一张芯片展示,称“这个芯片真的非常大”。ZPOednc

004ednc20190925ZPOednc

张建锋表示,“含光800”是阿里平头哥成立后首款正式流片的芯片,并表示含光800性能“吊打”同行。ZPOednc

据达摩院介绍,在业界标准的ResNet-50测试中,含光800推理性能达到78563 IPS,比目前业界最好的AI芯片性能(第二名:15012)高5倍;能效比500 IPS/W,是第二名的3.3倍,张建锋称:“含光800是阿里巴巴在芯片领域的万里长征第一步。”ZPOednc

005ednc20190925ZPOednc

据张建锋称,这是全球最高性能的AI推理芯片,一块含光800相当于10块GPU。ZPOednc

据了解,不同于基于冯·诺依曼架构的传统通用处理器,含光800根据神经网络推理运算特征,设计特定的硬件神经元、高速连接的存储结构以及专用指令集,对内存和计算单元实现高效组织管理,实现单条指令完成多个操作,提高计算效率和内存访问效率。ZPOednc

006ednc20190925ZPOednc

在杭州城市大脑里,视频实时处理使用GPU需要40块,延时300ms,单路视频功耗2.8W;而使用含光800仅需4块,延时150ms,单路视频功耗1W,有效节约了硬件和时间成本。ZPOednc

不过,阿里在现场并没有给出Tops、功耗等数据,也没有给出对标的GPU具体品牌与产品线,让这对比的参数多少有些不明确。ZPOednc

从设计到流片只用了一年半时间

张建锋表示,这块芯片从设计到流片只用了一年半时间。ZPOednc

据了解,平头哥用7个月完成了前端设计,之后用3个月就成功流片。仅成立一年的平头哥半导体为何这么快就能设计出云端AI芯片?ZPOednc

007ednc20190925ZPOednc

要知道,芯片作为典型的长周期产品,想加速芯片的商用,在硬件和软件方面都需要有很强的实力,特别是在AI时代,软硬一体化的重要性更加突显。平头哥就得益于阿里在软硬件方面的积累:ZPOednc

算法方面,阿里巴巴达摩院机器智能实验室过去两年构建了完整的算法体系,涵盖语音智能、语言技术、机器视觉、决策智能等方向,并且取得多个世界领先水平的成果;硬件方面,阿里巴巴此前已在服务器、FPGA以及存储等领域拥有多年研发经验,此外,平头哥团队在体系结构、编译技术等领域拥有深厚的技术储备。ZPOednc

含光800性能的突破得益于软硬件的协同创新,芯片架构方面,含光800采用创新的架构,针对深度学习中使用的大量权重参数和张量数据,在支持稀疏压缩与量化处理的基础上,通过独特设计的数据访存与流水线处理技术,大大减低了I/O需求和数据的搬移。NPU同时深度优化了卷积,矩阵乘,向量计算和各种激活函数,通过高有效的硬件资源调度和全并行的数据流处理,把AI运算的性能和能效都推向极致。ZPOednc

其中,性能的提升必须解决内存墙问题。所谓的内存墙,是指采用采用冯诺依曼结构的处理器,存储和运算处理分离,当进行深度神经网络处理时,算力得到了提升,但大量读写运行操作会受到带宽限制,芯片的整体性能提升也同时受到限制。ZPOednc

平头哥的做法是通过自研架构大幅减少对内存的访问,在保证性能的情况下,把芯片功耗降到最低水平。具体而言,含光800会根据神经网络推理运算特征,设计特定的硬件、高速连接的存储结构以及专用指令集,对内存和计算单元实现高效组织管理,实现单条指令完成多个操作,提高计算效率和内存访问效率。ZPOednc

已应用于阿里巴巴集团内多个场景

据了解,目前,含光800已应用于阿里巴巴集团内多个场景,例如视频图像识别/分类/搜索、城市大脑等,未来还可应用于医疗影像、自动驾驶等领域。ZPOednc

比如,拍立淘商品库每天新增10亿商品图片,为了让用户快速从海量图片中精准搜索到商品,需要强大的计算力支撑,使用含光800搜索效率可提升12倍,时间从传统通用GPU的1小时缩减至5分钟。ZPOednc

过去半年,平头哥先后发布玄铁910、无剑SoC平台。随着含光800的发布,平头哥端云一体全栈产品系列初步成型,涵盖处理器IP、一站式芯片设计平台和AI芯片,实现了芯片设计链路的全覆盖。ZPOednc

张建锋说,这块芯片只是阿里万里长征第一步,今天阿里有足够的信心、能力,把传统硬件公司能做到的、不能做到的都做到。未来,阿里成为软硬件一体化协同发展的公司。ZPOednc

责编:Demi XiaZPOednc

(综合整理自澎湃新闻、智东西、雷锋网等)ZPOednc

本文为EDN电子技术设计 原创文章,禁止转载。请尊重知识产权,违者本司保留追究责任的权利。
  • 微信扫一扫
    一键转发
  • 最前沿的电子设计资讯
    请关注“电子技术设计微信公众号”
您可能感兴趣的文章
  • 软件代理接口实现同步突发读取 微处理器的外部总线接口(EBI)用于访问或控制外设,在硬件接口加入二输出脚之后即可成为软件代理内存接口(SPMI)。SPMI可以调整硬件架构来实现同步突发读取,但不必增加硬件接口的引脚数。
  • 拆解vivo首款5G双模手机X30 Pro:潜望式镜头有什么设计 此前EDN曾报道了搭载麒麟990系列处理器的华为5G双模手机荣耀V30 Pro,文中指出荣耀V30 Pro的主板上,除了存储内存外,采用的其他芯片均出自华为海思,该文引起了网友的热烈讨论。那么同为国产的vivo这款5G双模手机内部构造如何呢?
  • 揭开隐藏140年的霍尔效应秘密 IBM研究人员发现了一个与霍尔效应相关的140年的秘密,这个之前不为人所知的特性可望为改善半导体性能开辟一个新的途径。
  • 资深大牛分享FPGA设计的经验技巧 任何编程语言的学习都不是一朝一夕的事,经验技巧的积累都是在点滴中完成,FPGA设计也无例外。下面就以我的切身体会,谈谈FPGA设计的经验技巧。
  • 老外拆解荣耀V30 Pro,惊叹:芯片基本靠自研! 从双模5G到麒麟990系列处理器,荣耀V30 Pro亮出了华为5G终端标杆的底气。伴随着影像方面的巨大跃升,荣耀V30 Pro的外观也发生了很大的变化,但其内部的构造发生了哪些变化呢?
  • 拆解华强北360元山寨AirPods Pro,内部粗糙凌乱 在AirPods Pro发售不久后,知名拆解网站 iFixit 就详尽拆解了AirPods Pro ,EDN也发表了这份拆解报告。不少网友一边吐槽AirPods Pro的外观设计,另一边却又因降噪功能纷纷入手这款“豌豆射手”。“山寨殿堂”华强北当然不会放过这款火爆的产品,这不,小编在最近的朋友圈看到,山寨的AirPods pro开始量产……
相关推荐
    广告
    近期热点
    广告
    广告
    广告
    可能感兴趣的话题
    广告