11月19日,华为在深圳举办2019全球数据基础设施论坛,面向鲲鹏计算行业,宣布全面启动数据基础设施战略,开源数据虚拟化引擎HetuEngine,希望合作伙伴能够像使用“数据库”一样使用“大数据”,让数据治理和使用更简单。
这是继今年9月基于“鲲鹏+盛腾”双引擎全面推出计算战略后,华为从数据角度对计算战略的重新解读。华为的数据基础设施战略围绕数据“采集-存储-计算-管理-使用”的全生命周期,阐释了华为通过提供融合、智能、开放的数据基础设施,可以让各行各业的客户释放数据价值,让智能达到各个层面。

华为云 AI产品与服务总裁侯金龙在大会上发表主题演讲。
以下为侯金龙演讲全文
女士们,先生们,朋友们,早上好!欢迎来到深圳参加首届全球数据基础设施论坛。
人类正在进入万物互联的智能时代,数据将成为智能世界的关键生产资料。今天我分享的主题是“构建融合、智能、开放的数据基础设施,携手智能时代”。
用万物互联构建智能世界
华为的愿景和使命是:“将数字世界带入每个人、每个家庭、每个组织,构建万物互联的智能世界”。在智能世界,计算能力成为新的生产力,数据成为新的生产手段,“5G、AI、云”成为新的生产工具,这将使成千上万的商业进入智能时代。
两个月前,华为在全连接大会上发布了“一云两翼双引擎”的鲲鹏计算产业布局。基于“鲲鹏+盛腾”双引擎,华为全面启动计算战略,为全球提供最强计算能力。
“一朵云”指的是华为云,是生态伙伴发展的黑土地。“两翼”是指智能计算和智能数据。作为数据彭坤行业的关键一翼,华为将围绕数据建立端到端的能力,包括存储、计算和使用的能力。通过5G+云+AI能力,构建“融合、智能、开放”的数据基础设施,释放数据价值,让智能无所不能!
智能世界,从数据管理到数据运营
首先,数据将推动客户体验。打开一个App,就会收到你感兴趣的内容推送。精准推送的背后,其实是数据在推动。比如在Aauto Quicker中,每天产生1.2亿个内容标签,实时匹配用户画像,数据化运营实现内容的精准推送。
其次,在企业的经营活动中,数据驱动着企业的生产决策。以大港油田为例,经过50年的连续开采,面临着资源枯竭和产量下降的挑战。2019年以来,大港油田采用华为大数据和AI技术,利用测井曲线和经验模型生成了每口井的孔隙度和渗透率,发现了更多新的油气藏。通过数据运算,为500万吨的长期稳定生产提供决策支持。
最后,我介绍了数据驱动的业务流程简化。华为每年出差近300万次。以前出差要涉及考勤、机票、酒店、报销等十几个申请流程。现在,真正实现“说走就走”,只需要一个流程。这是每天45万次后台数据关联碰撞的结果。数据运营,做到“让数据多跑路,员工少跑腿”。
智能世界的需求和资源之间存在巨大的缺口。
随着5G、AI、云的普及,数据量正以惊人的速度增长:从1080P到4K、8K,视频数据量将增长40倍,从4K到4K VR增长6倍以上;未来,每辆自动驾驶汽车每天将产生高达64 TB的数据;深圳一个城市有200多万个摄像头,每天会产生80 PB的数据,平均保存30天。大家都希望保持的时间长一点;大量数据过去只存储几天,现在需要存储几个月甚至永久。
根据预测,全球数据量将从2018年的33个ZB快速增长到2025年的180个ZB。但是,保存的生成数据不到2%,应用的保存数据不到10%。
这些海量数据增长的背后,是需要海量存储和计算的资源。数据增长是无限的,但存储资源是有限的。

完整的数据生命周期、每位的最大价值和每位的最佳成本。
我们希望实现数据采集、存储、计算、管理、使用的端到端整合和优化,让数据在整个生命周期内得到更好的利用,每一比特数据的价值最大化,每一比特数据的成本最优!
创建“融合、智能和开放”的数据基础设施
为了实现这一追求,华为构建融合、智能、开放的数据基础设施,让数据系统从隔离走向融合,从复杂走向智能,从封闭走向开放:
通过“打破数据处理和数据存储的边界”,实现高效的数据共享和分析,降低成本,提高效率。通过“AI+存储+云”,实现数据全生命周期的智能管理和智能运营,让存储越用越快,价值越来越大。通过“数据虚拟化引擎”,统一SQL语法,像数据库一样使用大数据。融合:使用极简主义
数据应用的核心包括存储和分析。烟囱IT业务系统带来两个问题:存储时会产生多个冗余副本,数据无法流动,存储成本高;分析时会移动大量数据,分析效率低。
通过10多年的技术积累和创新,华为在存储、数据库和大数据技术方面实现了一系列突破。通过打破四面墙,每一位数据都具有最大的价值和每一位数据的最佳成本。
打破存储内部系统墙:通过一套架构实现生产、分析、备份、归档的统一管理。一段数据在每个系统中顺畅地流动,减少了30%以上的拷贝和总体拥有成本。打破数据库与存储的链接墙:近数据计算通过操作符下推实现,减少了存储层与计算层的数据交换,数据访问和处理性能提升2倍。打破大数据和存储分配的围墙:通过存储和计算的分离,实现资源的灵活分配。如果计算不足,则扩展计算,如果存储不足,则扩展存储。通过弹性EC和数据缩减技术减少冗余,整体TCO降低30%以上。打破数据库与大数据的协同墙:通过协同分析实现零数据重定位,数据库与大数据共享一个数据,分析效率提升100%。智能:体验极致。
以前设备配置和运维主要靠人来完成,管理效率由运维人员的经验和能力决定。华为基于AI芯片、存储、华为云三层架构,通过云训练、云推理,让系统使用更快、更快、更经济。
依托瑞星处理器的AI能力,可以自动学习识别IO流,提高缓存预取命中率,系统整体性能提升20%。依托鲲鹏处理器的多计算能力,根据不同数据类型实时优化数据约简算法,TCO降低25%。结合华为云自身大规模运维经验,目前可以提前14天预测硬盘故障,提前60天预测性能瓶颈,提前365天预测容量不足,其中30%的故障可以自我修复。开放:发展简约主义
随着业务类型越来越多,大量业务需要跨平台、跨数据源的协同分析。在这种情况下,三个最突出的问题是:寻找、检索和使用数字的困难。
找数据难:传统企业的数据类型越来越多,结构化、半结构化、非结构化数据并存,缺乏统一的数据目录和全局数据视图。在众多异构数据源中查找特定数据就像大海捞针。数据检索困难:典型的分析业务通常依赖于跨地域、跨平台的数据协同,需要从多个业务系统获取数据,这些数据只能通过多个部门之间的协调和验证才能获得。难用:多业务分析需要多引擎协作,会依赖多种数据访问技术,需要开发人员掌握多种开发工具和语言,导致开发门槛较高,开发周期较长。为了屏蔽数据类型差异、地域差异、语法差异,让数据管理简单易用,华为推出了“河图引擎”。
从“大数据”到“大数据库”
我们将数据虚拟化引擎命名为River Map,就是为了屏蔽数据基础设施的复杂性,让开发者像使用数据库一样使用大数据,重用现有的生态、工具和技能,提高开发效率2到10倍。“大禹得了河图后,见了清明”。相传大禹通过河图掌握了复杂的河山地形,成功完成了治水大业。
河图引擎是为了让数据管理简单易用,更方便挖掘数据价值。它有四个核心能力:

一个目录:通过在线感知元数据,构建1000+异地异构数据源的全局虚拟数据视图,打破数据孤岛,让数据全局可见,解决企业找数据难的问题。一个门户:通过开放的连接框架和5000节点SQL引擎,实现30个异地异构数据源的统一SQL访问,全局获取数据,解决企业数据检索难的问题。一片数据:通过CarbonData技术,实现一片数据的多场景分析、多应用共享、数据零迁移、数据全局可用,解决企业数据使用难的问题。安全:通过细粒度的动态授权和敏感数据自动感知技术,实现异地异构数据源的集中安全配置和控制,数据可全局管控,数据授权时间从天到秒,解决企业数据安全合规问题。开源河流地图引擎HetuEngine
为了更好的发展数据行业,今天我宣布开源河图引擎。河流地图引擎的开源版本名为openHetu,将于2020年6月上线。我们会开源内核,开发者可以基于开源代码进行定制,包括数据源扩展、SQL执行策略等。,实现应用快速对接,提高开发效率。
平台+生态,携手智能时代
华为一直践行“平台+生态”的战略。华为通过开放硬件、开源软件、赋能合作伙伴,构建开放繁荣的鲲鹏计算产业生态,共同进入智能时代。
谢谢大家!


