APP下载
报价宝  ›  科技  › 

智慧运维发展史及核心技术研究_系统

报价宝 来源:baojiabao.com 发布时间:2019-11-11 07:51:00 10月01日更新
报价宝综合消息智慧运维发展史及核心技术研究_系统

作者介绍陈林博,工学博士,毕业于同济大学计算机系统结构专业。目前从事基础技术框架研发、云端计算研究与应用、智慧运维研究与应用等工作。

何支军,工程硕士,毕业于复旦大学微电子专业。现任中国结算上海分公司技术开发部总监,长期从事登记结算技术系统的建设和运维工作。

颜挺进,工学硕士,毕业于大连理工大学。长期从事技术系统应用架构研发、批处理架构研发、线上系统设计等工作。

焦振海,工学硕士,毕业于南京大学计算机系。长期从事基础技术框架研发、线上系统设计等工作。

李乔,工学硕士,毕业于北京大学软件工程专业。从事批处理架构研发、智慧运维研发、资料分析与视觉化等工作。

王铭玮,工学硕士,毕业于英国帝国理工学院电子电气工程系。从事基础技术框架研发与维护等、批处理架构研发等工作。

技术系统的安全稳定执行是我司最重要的工作之一,而运维是保障系统稳定执行的重要手段。

在技术系统转型过程中,传统运维模式面临“安全执行、人力紧缺、远端运维”三大挑战,有必要引入人工智能来辅助甚至部分替代人工决策,提升运维质量和效率。

本文对智慧运维技术进行了探索,分析当前智慧运维研究的进度及现状,研究如何在运维中引入人工智能,以实现“事前智慧预警、事后快速定位、夜间无人值守、远端集中管理”等一系列的智慧运维目标,以应对新环境下的三大运维挑战。

一、引言

运维是技术类运营维护人员根据业务需求来规划资讯、网络、服务,通过网络监控、事件预警、业务排程、排障升级等手段,使服务处于长期稳定可用的状态。早期的运维工作大部分是由运维人员手工完成,这种运维模式不仅低效,也消耗了大量的人力资源。

利用工具来实现大规模和批量化的自动化运维,能极大地减少了人力成本,降低了操作风险,提高了运维效率。但是自动化运维的本质依然是人与自动化工具相结合的运维模式,受限于人类自身的生理极限以及认识的局限,无法持续地面向大规模、高复杂性的系统提供高质量的运维服务。

智慧运维(AIOps, Artificial Intelligence for IT Operations)是指通过机器学习等人工智能演算法,自动地从海量运维资料中学习并总结规则,并作出决策的运维方式。智慧运维能快速分析处理海量资料,并得出有效的运维决策,执行自动化指令码以实现对系统的整体运维,能有效运维大规模系统。

自1998年至今,经过20多年的逐步升级和持续优化,登记结算系统在业务功能上已较为完备,形成了全品类、全链条、跨市场的业务系统。

随着沪港通、科创板、沪伦通等创新业务的陆续实施,证券登记结算系统与外部的耦合度逐渐增加,而现有的技术系统已经很难满足不同市场、不同日历、不同品种的互联互通需求。

因此为进一步更好地服务实体经济、满足资本市场双向开放,技术系统必须从专有化向国产化转型,从集中式向开放分散式转型,从单资料中心向多资料中心转型。而在转型发展中,技术系统传统运维模式面临以下三大挑战:

技术发展中产生的问题必须依靠技术来解决,只有在运维领域引入新技术、新思路、新体系,才能更好地提升运维水平,更好地保障系统安全稳定高效的执行。

当前主流运维技术已从自动化运维向智慧运维发展,利用人工智能来辅助甚至部分替代人工决策,可以进一步提升运维质量和效率。

因此,我司开展了智慧运维技术的探索,研究如何在运维中引入人工智能,以实现事前智慧预警、事后快速定位、夜间无人值守、远端集中管理等一系列的智慧运维目标,以应对新环境下的三大运维挑战,进一步解放与发展生产力。

二、智慧运维发展及主要技术研究

1、智慧运维简介

智慧运维(AIOps)是指通过机器学习等人工智能演算法,自动地从海量运维资料中学习并总结规则,并作出决策的运维方式。

智慧运维概念最早由Gartner提出,它是将人工智能科技融入运维系统中,以大资料和机器学习为基础,从多种资料来源中采集海量资料(包括日志、业务资料、系统资料等)进行实时或离线分析,通过主动性、人性化和动态视觉化,增强传统运维的能力。

尽管智慧运维是运维领域最新技术,其应用的人工智能产业目前也是朝阳产业,在技术成熟度上仍有待提升,但并不妨碍智慧运维所产生的强大生产力。

表1给出了手工运维、自动化运维、智慧运维在运维效率、系统可用性、可靠性、学习成本、建设成本、应用范围作了全面的比较。

▲ 表1 三种运维模式的比较

2、智慧运维研究与应用现状

当前智慧运维研究与应用在国内外各行业中都属于起步阶段,Gartner的报告中也做出预测:智慧运维在2020年在一半以上的企业中落地并形成生产力,如下图所示:

尽管如此,智慧运维已经成为科研机构研究的热点,并在高利润、低成本的驱动下,互联网公司、大型金融机构、大型IT技术公司走在了智慧运维工程应用方面的前列。

1)科研机构

科研机构一向是新技术革命的领头羊。在智慧运维研究领域,国内外科研机构不仅有先进的科研成果,也与工业界展开密切合作,从演算法层面上支撑了智慧运维的落地与发展。

卡内基梅隆大学与Netflix公司合作,在网络视讯运维领域提出并应用多种人工智能方法:

南京大学周志华教授团队专注于机器学习演算法的研究,所提出的isolation forest孤立森林演算法可用于挖掘异常资料,检测和分析异常。该方法已经在360公司系统运维中用以实时检测异常,腾讯公司也将其用于检测微信中的异常点选。

清华大学NetMan智慧运维实验室则专注于异常检测、分析与预测,提出了多种演算法和工具。该团队目前已经和交通银行、阿里巴巴、IBM等多家机构开展合作,实现了产学研相结合。

2)互联网行业

阿里巴巴研发了智慧故障管理平台,以业务为导向,实现了基于机器学习的业务异常检测,准确及时发现故障。通过时间序列分析和机器学习,对未来一段时间的业务指标趋势进行预测。针对业务异常时间,自动呼叫各型别AP界面实现一键切换,快速恢复业务异常。并针对业务异常事件自动拆解相关维度,逐层剥离定位故障原因。

目前该平台已经在阿里云上成功实践,故障发现准确率、故障发现召回率分别提升到80%和90%,每周节省因为误报而花费的操作时间约为29小时。

百度实现了基于智慧流量排程的单机房故障自愈能力,将止损过程划分为统一的感知、决策、执行三个阶段,通过策略框架支援智慧化异常检测、策略编排、流量排程,实现了单机房故障自愈能力。

京东金融实现了基于网络拓扑的根源告警分析,结合呼叫链,通过时间相关性、权重、关联规则演算法、神经网络演算法等,将告警分类筛选,快速找到告警根源,从而缩短故障排查及恢复时间。

京东金融还在其云端计算资料中心应用了智慧巡检机器人,提升了机房及资料中心的巡检效率和智慧化管理水平,避免人工的错检和漏检,对巡检资料进行资料化管理和高效利用。

腾讯在其织云监控平台中建设了基于机器学习的时间序列异常检测方案,在百万条基于时间序列的日志资讯中,以少量的时间实现了异常检测。

3)金融行业

交通银行通过资料中心运维大资料平台的建设,将各类日志、告警等运维资料统一集中储存。通过关联分析、建模预测等方式发现日志、告警资讯中潜在联络,并建设监控历史资料分析、监控告警智慧分析以及日志智慧检索分析等大资料运维应用场景,实现了事前智慧预警、事后快速定位故障。

中国银行初步形成了“运维大资料仓库”、“运维资料分析平台”的计算框架,对系统日志、应用日志、监控资料和网络映象包等全量资料进行集中存放和处理,并在异常检测、故障快速定位、系统容量预估和动态调配等多个场景中应用。

太平洋保险在智慧运维方面实现了告警收敛,将多个告警做汇聚合并和主源分析,还开展了云脑专案以实现业务趋势预测和容量管理功能,还开发点点2.0 APP,实现风险监测和智慧互动等功能。

阳光保险利用大资料和机器学习,实现了智慧巡检、报警聚合、故障自愈及故障避免、自动发版与止损等多项功能。招商银行在效能容量评估、故障定位与诊断方面采用智慧运维的方案,以应对业务高峰的需求。

上海银行张江资料中心启用了智慧巡检机器人,对装置执行状态、机房环境、机柜微环境实时监测,保证资料中心状态实时可视、可控及资料的准确性。

4)技术厂商

Splunk公司擅长大资料的搜寻与视觉化,该公司以splunk平台为基础研发了智慧运维管理平台,它将收集到的机器资料转化为有运维价值的见解,让使用者能实时了解IT系统与技术构架现状,以便做出决策。

IBM公司认为智慧运维的目标是对异常做出预警,在问题暴露前优化校正服务,以避免对业务造成影响。为此,IBM提出了实时大资料分析驱动的新一代智慧运维中心解决方案,对事件日志进行上下文历史挖掘分析、周期性规律分析、成对成组出现分析、日志相关与因果分析。

目前该方案目前已在交通银行得到实施与应用。不仅如此,IBM还发布了《金融行业智慧运维AIOps实施建议白皮书》。

华为推出了基于大资料平台的FabricInsight资料中心网络智慧分析平台。它基于 telemetry,采集全网真实流评估网络质量,进行网络异常流识别和分析,实现风险主动预测。FabricInsight将应用和网络路径关联,能够对埠级问题进行快速定位,还支援百亿资料秒级检索,并实现时延、路径等多维度历史资料可视。

在智慧机器人巡检方面,深圳朗驰欣创研发的室内智慧巡检机器人,可实现对资料机房7*24小时不间断往复式巡检任务,对资料中心环境和装置进行智慧检测,对电源、空调、服务器等指示灯和仪表状态进行自主巡视和判断分析。其产品分为轨道式巡检机器人和轮式巡检机器人,目前已应用于国家电网资料中心和IDC资料中心。

浙江国自与阿里巴巴联合研发的高精度资料中心智慧巡检机器人“天巡”于2017年云栖大会正式释出,它可以协助工作人员对资料中心环境进行日常巡检、远端任务呼叫、随工监管和安防管理工作。

目前“天巡”已部署应用于阿里巴巴张北资料中心,根据实际应用看,“天巡”不仅实现全天24小时巡检,而且接替了运维人员以往30%的重复性工作,在大幅提升工作效率的同时,可以让工作人员有时间去做创造性的工作。

京东金融于2018年正式释出巡检机器人,可实现自动导航与避障、自主充电、环境温湿度检测、装置编码识别、装置指示灯识别、装置故障码识别、环境异物识别、人员身份验证、引导和跟随等功能,并可通过实时资料传输,在巡检管理后台进行远端监测和结果查询。

目前巡检机器人已部署于京东金融资料中心,在6.18期间已经受了严苛的实战检验,提升了资料中心的巡检效率和智慧化管理水平,避免人工的错检和漏检,与传统人工巡检方式相比,效率更高,成本更低。

京东金融还在其云端计算资料中心应用了智慧巡检机器人,提升了机房及资料中心的巡检效率和智慧化管理水平,避免人工的错检和漏检,对巡检资料进行资料化管理和高效利用。

京东金融还在其云端计算资料中心应用了智慧巡检机器人,提升了机房及资料中心的巡检效率和智慧化管理水平,避免人工的错检和漏检,对巡检资料进行资料化管理和高效利用。

3、核心技术研究

智慧运维是基于机器学习等人工智能演算法,分析挖掘运维大资料,并利用自动化工具实施运维决策的过程。因此,智慧运维的技术主要组成是运维大资料平台、智慧分析决策元件、自动化工具,如下图所示:

运维大资料平台如同眼一样,能采集、处理、储存、展示各种运维资料。智慧分析决策元件如同大脑,它以眼睛感知到的资料作为输入,作出实时的运维决策,从而驱动自动化工具实施操作。自动化工具如同手一样,能根据运维决策,实施具体的运维操作,如重启、回滚、扩缩容等。

1)运维大资料平台

① 运维大资料

运维大资料平台用于对各种运维资料进行采集、处理、储存、展示的统一平台。运维资料包含监控资料、日志资料、配置资讯等,其详细组成如下表所示:

▲ 表2 运维大资料组成

大资料平台所储存的资料,按照所更新的频率可分为静态资料和动态资料。静态资料主要包含CMDB资料、变更管理资料、流程管理资料、平台配置资讯资料等。

此类资料一般情况下在一定时间范围内是固定不变,主要是为动态资料分析提供基础的配置资讯。对此类资料的查询操作多,增删改操作较少。

当智慧运维平台启动时,部分静态资料可直接载入到内存数据库中,因此静态资料一般储存在结构化数据库中或者Hive平台。

动态资料主要包含各类监控指标资料、日志资料以及第三方扩充套件应用所产生的资料。此类资料一般是实时生成并被获取,并作为基础资料,需要通过资料清洗转换成可使用的样本资料。

动态资料一般按不同的使用场景储存在不同大资料元件中,如用于分析的资料储存在Hive数据库,用于检索的日志资料可储存在ES(即ElasticSearch)中。

② 运维大资料平台

参考大资料平台的架构,运维大资料平台由资料采集层、资料储存层、资料分析建模层、展示层等组成,其逻辑架构如下图所示。

资料采集处理层是整个大资料平台的资料来源,所接入的运维资料型别包括日志资料、效能指标资料、网络抓包资料、使用者行为资料、告警资料、配置管理资料、运维流程类资料等,其格式包括系统中的结构化资料、半/非结构化资料、以及实时流资料。

采集方式可分为代理采集和无代理采集,其中代理采集一般为拉的方式,在采集端部署agent来采集,无代理采集一般利用logstash、flume等元件直接获取运维资料。在该层也会对资料做预处理,使其能满足定义的格式,用以在资料储存层落地。

资料储存层是用于落地运维资料,可根据不同的资料型别、资料消费和使用场景,选择不同的资料储存方式。

资料计算层提供实时和离线计算框架,离线计算是针对储存的历史资料进行批量分析与计算,可用于大资料量的离线模型训练和计算,如告警关联关系挖掘、趋势预测计算、容量预测模型计算等。

实时计算是对流处理中实时资料进行线上计算,包括资料查询、预处理、统计分析、异常资料实时监测。目前主流的流计算框架包括Spark Streaming、Kafka Streaming、Flink、Storm等。

展示层为使用者提供视觉化方式展示时序指标资料,并提供统一的告警监控配置和监控告警通知功能,还可以为业务应用提供分析展示功能,帮助业务人员实时了解业务应用状态。目前主流的开源框架有kibana、Graphic等。

2)智慧分析决策元件

在智慧运维平台中,如果将大资料运维平台比喻成“眼睛”,用于直接感知运维资料,自动化工具比喻成“手”,用于直接处理运维操作,那么智慧运维元件相当于“大脑”功能,用于对运维事件进行分析、处理,并作出决策。

智慧运维元件是利用人工智能演算法,根据具体的运维场景、业务规则或专家经验等构建的元件,类似于程式中的API或公共库,它具有可重用、可演进、可了解的特性。智慧运维元件按照功能型别可分为两大类,分别是运维知识图谱类和动态决策类。

① 运维知识图谱类元件

运维知识图谱类的元件是通过多种演算法挖掘运维历史资料,从而得出运维主体各类特性画像和规律,以及运维主体之间的关系,形成运维知识图谱。

其中,运维主体是指系统软硬件及其执行状态,软件包括操作系统、中介软件、数据库、应用、应用例项、模组、服务、微服务、储存服务等,硬件包括机房、机群、机架、服务器、虚机、容器、硬盘、交换机、路由器等,执行状态主要是由指标、日志事件、变更、Trace等监控资料体现。运维知识图谱类的元件如下图所示:

▲ 运维知识图谱的元件示意图

以故障失效传播链构建为例,故障失效传播链构建是对失效现象进行回本溯源的分析,查询引起该失效的可能的故障原因。一种对故障失效传播链的智慧分析方法是基于故障树的分析方法,通过模组呼叫链获得模组之间逻辑呼叫关系,以及配置资讯所获得的物理模组的关联关系,构成可能的故障树用以描述故障传播链。

利用机器学习的方法,对该故障树进行联动分析与剪枝,形成最终的子树,即故障失效传播链。其他的演算法,包括FP-Growth、Apriori、随机森林、Pearson关联分析,J-Measure,Two-sample test等。

② 动态决策类元件

动态决策类元件则是在已经挖掘好的运维知识图谱的基础上,利用实时监控资料作出实时决策,最终形成运维策略库。实时决策主要有异常检测、故障定位、故障处置、故障规避等,如下图所示:

▲ 动态决策类元件的示意图

动态决策类元件一般是对当前的日志或事件进行分析,对其作出及时响应与决策,甚至判断未来一段时间内系统执行状态进行预测。可以将异常发现、故障定位、异常处置作为一种被动的运维,异常规避则是一种主动主动异常管理的方式,准确度高的预测能提高服务的稳定性。

以故障预测为例,预测是基于历史经验的基础上,使用多种模型或方法对现有的系统状态进行分析,判断未来某一段时间内发生失效的概率。

预测是一种主动异常管理的方式,准确度高的预测能提高服务的稳定性。通过智慧预测的结果,运维人员可采用多种运维手段,如切换流量、替换装置等方式规避系统失效。

基于故障特征的预测是在离线状态下从历史系统日志中通过机器学习演算法提取出异常特征,对模型进行训练。线上上预测阶段,将实时的执行状态资讯与模型中的异常特征进行匹配,从而确定未来某时间段系统失效的概率。

3)自动化工具

自动化工具是基于确定逻辑的运维工具,对技术系统实施诸如执行控制、监控、重启、回滚、版本变更、流量控制等系列操作,是对技术系统实施运维的手段,用以维护技术系统的安全、稳定、可靠执行。自动化工具是自动化运维的产物,也是智慧运维元件作出决策后,实施具体运维操作所依赖的工具。

自动化工具按照功能可分为两类:监控报警类自动化工具、运维操作类自动化工具。监控报警类自动化工具是对各类IT资源(包括服务器、数据库、中介软件、储存备份、网络、安全、机房、业务应用、操作系统、虚拟化等)进行实时监控,对异常情况进行报警。并能对故障根源告警进行归并处理,以解决特殊情况下告警泛滥的问题,例如机房断网造成的批量服务器报警。

运维操作自动化工具主要是把运维一系列的手工执行繁琐的工作,按照日常正确的维护流程分步编写成指令码,然后由自动化运维工具按流程编排成作业自动化执行,如执行控制、备份、重启、版本变更与回滚、流量控制等。

三、我司智慧运维平台技术研究

1、智慧运维目标

结合我司技术系统运维现状与未来的发展需求,实现智慧运维的主要目标可归纳为:“事前智慧预警、事后快速定位、夜间无人值守、远端集中管理”。

事前智慧预警是在异常发生前,就能通过微小的征兆提前感知。因此,事前智慧预警一方面要实现自检能力,在业务实际发生前,实施自我检查,判断应用与系统的可用性,提前感知业务的可用能力。

另一方面要对系统软硬件的指标体系、日志、事件进行监测,构建基于历史执行资讯的系统功能与效能画像、效能预测模型等,并根据当前的执行资讯预测未来一段时间内系统失效的概率,以达到提前预警的目的。

事后快速定位是在异常发生后,在众多繁杂的报警资讯中分析并定位住产生异常的原因,甚至还能基于历史处理的经验,给出最好的运维决策。它是对故障失效传播链、智慧异常检测、异常报警聚合的综合运用。

考虑到交易结算系统是证券市场核心基础设施,需全天候安全保障。但在非交易非日终处理时段,特别是夜间,系统所需处理的业务量相对较低。而此时系统值守则是非常繁琐枯燥,因此需实现夜间无人值守,解决现阶段夜间值守困境。

远端集中管理则是对地理位置偏僻的资料中心采取远端监管的手段,以多种智慧手段,如智慧巡检机器人,代替人工巡检。从而减少派驻现场值守的人员数量,降低运维成本,解决人力资源紧张等问题。

2、应用场景分析

1)智慧预警

智慧预警则是在异常发生前,预测异常发生的概率,从而提醒或有针对性的对异常提前规避。智慧预警有如下两类典型应用场景:

2)智慧检测

智慧检测则是从事前分析、事中告警聚合、故障定位、事后经验沉淀等方面,来辅助运维人员的决策过程,实现对异常快速有效处理。

3)智慧值守

机房智慧值守主要体现在以下方面:

通过对技术系统的智慧值守,可将值班人员从检视监控资料、盯屏等琐碎操作中解脱,转而研究如何定义新的运维场景、建立运维模型、完善运维知识图谱等方面,从而提升运维效率。

4)智慧巡检

资料中心巡检是保证资料中心安全执行,提高可靠性的一项基础工作。机房智慧巡检则可引入智慧巡检机器人、定点摄像实时监控机器人,对IT装置、机房环境进行巡检或定点监控。

使用机器人代替人工巡检,对装置状态和环境状态进行全天候全自主检测,可以有效地提高巡检质量、提升巡检效率、降低人工劳动强度,减少人为的疏漏,及时发现异常,大大提高资料中心安全执行可靠性,为无人值守机房的最终目标实现提供了技术手段。

四、智慧运维平台原型验证

为验证我司技术系统实施智慧运维的可行性,在已有的技术系统环境中搭建了智慧运维原型平台,该原型平台由大资料运维平台、智慧元件、监控平台所组成。该原型平台对已有的技术系统部分运维资料作为研究物件,在事前智慧预警方面,着眼于效能预测、异常预测,以实验验证了智慧运维在我司开展的可行性及其所带来强大生产力。

1、原型架构

智慧运维平台原型系统的逻辑架构如下图所示:

其中,利用flume采集AIX平台上的日志资讯,logstash用以采集Linux平台的日志资讯。所建立的运维大资料平台则包括资料采集与储存、资料分析及建模、展现等。

资料采集及储存采用了分散式采集策略,可动态实施采集任务,实现了高频率的基础资源的资料采集,可将主机、虚拟机器器、网络和储存等一切可以采集的资料全部抓取出来。

如主机、虚拟机器器CPU 和内存的执行时资讯,网络交换机界面的流量,储存池读写 IO,虚拟机器器系统日志等资料。离线档案采用Hadoop分散式储存采集的资讯,实时采集及处理档案采用LogStash进行储存。

资料分析及建模则采用了基于 Hadoop+Spark 的结构,Hadoop 提供任务排程和分散式档案储存功能,Spark 将资料放在内存中实现 MapReduce 计算,这种结构能大幅度的提升资料处理的效率,满足系统日志分析实时性的要求,也能将计算结果储存到数据库中,避免重复计算和方便使用者查询。

展示模组是用图表工具将监控系统、大资料以及各个渠道收集的各种资料用图形化方式展现,使不可视的运维资料变成可视的直观图形,展现各个基础资源的执行状况和分析结果,让技术人员和非技术人员都能直观地理解并关注。

目前,Hadoop高可用部署主机部署情况如下表所示:

▲ 表3 Hadoop部署情况说明

与Hadoop相关的主机有五台,分别命名为master1、master2、slave1、slave2、slave3。其中master1和master2作为NameNode,其他为DataNode。Zookeeper部署于master1、master2、slave1上,用于确保NameNode的高可用。

2、智慧预警场景一:日终节点执行时间预测

沪市证券登记结算系统是我司核心技术系统,它由A股/B股登记结算子系统、港股通结算子系统、期权结算子系统等组成,向各类市场参与人提供证券登记存管、清算和交收等各类功能。

为了能向市场提供高质量、高效率的结算资料服务,由自动批处理系统以节点方式对各个作业任务进行排程执行。在日终批处理后,结算资料将传送给各个参与人。

若能相对准确地预测日终各处理节点执行时间,找出从启动节点到结算资料传送节点的关键路径,即可预测出日终结算处理的用时以及结算资料传送的完成时点。

如果当日预测出的传送时点发现会影响参与人的日终结算处理以及下一交易日的开工准备,可提前通知相关人员做好准备,防范于未然。

日终节点执行时间预测是采集节点的历史执行资料,并在大资料平台中进行分析处理,利用机器学习演算法对这些节点的执行时间进行了预测。从实验结果可知,对节点效能进行智慧预测的结果符合需求。

1)预测演算法

日终处理节点根据是否受特征值影响分为两类,一类是受特征值影响较小或与几乎无关的节点,此类节点的时间预测可采用均值方法。另一类是受特征值影响较大的节点演算法,则需要用机器学习演算法进行预测。

利用机器学习演算法进行预测,可从节点执行历史资料中,获取影响各节点效能的变数资料作为特征值,如A股成交数量、非但保成交量、权益数量、回购成交数量等,采用机器学习演算法中的回归类演算法,对各节点构建执行时间的特征函式,然后在实际生产环境中,利用已知的特征值来预测效能。

目前可采用线性回归、决策树回归、随机森林回归、支援向量机(Support Vector Machine, SVM)回归、K最近邻(K-Nearest Neighbor, KNN)回归、Adaboost、梯度提升回归树(Gradient Boost Regression Tree, GBRT)等演算法。

2)实验设计

本次实验将以58个节点作为研究物件,利用机器学习演算法进行效能预测。选取的样本集从2017年8月1日至2018年5月25日(199个工作日),其中训练资料为149组,验证测试资料有50组。

所选取的11个特征向量包含:A股成交数量、非但保成交、权益数量、回购成交数量以及交易所输入资料等。对于一些缺失的节点历史执行资料,将使用其已有资料的均值进行填补。

本次实验的处理流程如下所示:

2)结果分析

实验所涉及的58个节点的预测值,其平均相对误差小于5%。以预测结果较好的日终存管资料传送(RZ06010000)节点为例,用50组资料(2018.3.13至2018.5.25期间的资料)进行测试,采用不同回归演算法所得到的预测结果与实际结果的比较示意图如下图所示,预测值的平均误差为9.21秒。

3、智慧预警场景二:关键路径智慧分析

日终节点的批处理过程是由一系列的节点根据依赖关系而组成的有序无环图,日终节点关键路径又称为最长路径,是指在一个工程中,从起点作业到终点作业间耗时最长的一条逻辑路径。一般来说,工程的完成时间取决于它的最长路径,而与其他耗时短的路径无关。

在日终节点执行时间预测的基础上,本文完成了对起始节点和终止节点间关键路径的预测。该项研究工作可以预测出日终处理过程中关键节点的最晚处理时间。

1)演算法分析

日终批处理节点执行图是一种有向无环图,图中任意一边有方向且不存在环路,在该图中,顶点表示操作节点,有向边上的权值为父节点的执行时间。

传统的关键路径演算法适用于只有一个起点和重点的拓扑图,但日终批处理节点执行图含有多个起点和重点,因此需采用其他演算法。本次实验采用了动态规划演算法、SPFA(Shortest Path Faster Algorithm)演算法。

动态规划(Dynamic Programming, DP)是把多阶段过程转换成单阶段问题并逐个求解的过程。其解决关键路径问题的核心思想是在起点和终点间加入一个点,并判断能否起点到终点的路径更长,这被称为松弛操作,若能更长将加入的点作为新的起点再进行松弛操作,如此递回得出最终的关键路径。

SPFA(Shortest Path Faster Algorithm)演算法是求最短路径Bellman-Ford演算法的伫列优化形式,做相应修改后也能解决关键路径问题。

具体实现方法是建立一个先进先出的伫列储存能更新关键路径的节点,并定义一个阵列储存起点到其余节点的最长路长度,每次更新时取出首节点,并对其进行松弛操作,若到子节点的关键路径有所调整,且子节点不在伫列中,则把子节点加入队尾并更新关键路径阵列,如此反复,直到伫列为空为止。

2)实验设计

由于目前无法为预测后的节点执行时间定义节点开始时间和互动时间,所以暂时用历史资料进行测试。输入输出同预测节点执行时间一样,从数据库中取出历史节点执行时间资料以及节点关系表,处理后将最后的关键路径结果(即从起点到终点的各个节点)输出至数据库表中。整体处理流程如下所示:

3)结果分析

选择2018年5月25日的资料进行测试,定义起点为A股日终前3494磁带备份(JBSYS53003),终点为日终存管资料传送(RZ06010000)。除去部分因业务规则而设定的固定时刻,其执行时间总时长为4172秒(约1个小时10分钟),预测结果与实际拟合度超过90%。

五、智慧运维实施路径

智慧运维的建设是从无到有的过程,是从区域性单点应用的探索到单点能力完善,再到形成解决某个区域性问题的一个过程,最终将各个智慧运维场景相结合,形成一体化智慧运维能力。因此智慧运维的实施路径可分为以下四个层面:

1、运维大资料平台建设

资料是智慧运维落地的基础,首先需要建立运维大资料平台,对运维资料进行采集、分析、计算、储存,并定义标准化的指标体系,对运维资料进行萃取,积累大量的可用的运维资料。

以效能指标体系为例,可对操作系统、数据库、中介软件等应用建立可供分析的效能指标体系,并在系统执行中获取效能资料,以此来刻画各应用的正常状态、异常状态的画像,为后续的检测、预测、分析等提供基础的运维知识图谱资料。

2、单点智慧化实践

其次,应从实际出发,立足当前运维痛点,从单点运维场景切入,如建立时序资料智慧异常发现、流量智慧异常告警、数据库智慧监控、智慧网络日志分析等能力,由点到面进行智慧化运维能力的建设,从而为后期进行区域性智慧化场景的实现打下基础。

以数据库智慧监控能力为例,运维人员可实时获取资料执行状态指标,当数据库出现异常时,运维人员可通过历史资料回溯、资料比对等方式进行故障跟踪、异常指标分析,从而形成标准化故障排查、分析能力和经验,为后期的数据库智慧故障预警、异常根因分析等区域性场景提供基础支援。

3、区域性场景智慧化

区域性场景智慧化是指对运维场景中硬件、系统、网络、数据库、中介软件等分别实现智慧监控、异常预警、故障发现、故障分析、根因分析、故障自愈等闭环场景。

以网络异常为例,当智慧运维系统检测到网络异常指标时,将出发告警时间,经运维人员确认故障后,智慧运维系统将通过机器学习演算法定位故障,然后呼叫自动化运维工具执行相应的修复操作,实现该场景下故障自愈。

区域性场景智慧化的实现,将使得故障发现、处理、排查效率得到极大的提升,有效保障业务稳定执行。同时,该能力的实现使得智慧化运维具备场景化、标准化、自动化等能力。

4、一体化智慧运维

一体化智慧运维是智慧运维系统发展的终极目标。该阶段不仅实现各运维场景智慧化闭环,且智慧运维能力与运维管理流程、运维组织架构、运维自动化是深入融合。

运维人员不再以发现故障、解决故障作为目标导向,转而专注业务执行状态,探索运维需求,定义并实现运维场景,丰富智慧运维的广度与深度。

注:本文选自《交易技术前沿》总第三十四期文章(2019年3月)中国证券登记结算有限责任公司上海分公司技术开发部 邮箱:[email protected]

作者:陈林博、何支军、颜挺进、焦振海、李乔、王铭玮

来源:上交所技术服务(ID:SSE-TechService)

dbaplus社群欢迎广大技术人员投稿,投稿邮箱:[email protected]

文章标签: 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 手机价格 汽车价格 笔记本电脑价格 红米手机价格 耳机价格