APP下载

Azure欧洲网络塞爆延迟通报客户,原因是管理员还没起床

消息来源:baojiabao.com 作者: 发布时间:2026-08-14

报价宝综合消息Azure欧洲网络塞爆延迟通报客户,原因是管理员还没起床

西欧时间3月24日到3月26日,欧洲及英国Azure用户感受到Windows及Linux agents开发作业变得十分慢。三天内共有6,136名客户感受到作业延迟,平均延迟21分钟,有人甚至等了9小时。图片来源/微软,https://status.dev.azure.com/_event/181122901/post-mortem

武汉肺炎疫情让许多人必须在家上班,Microsoft Azure等云端服务一旦断线或不稳,将严重影响工作效率。上月底Azure发生网络塞爆问题,微软却等了5小时才向用户说明情况。周四微软解释,因为负责管理的人员当时还在被窝中。

西欧时间3月24日到3月26日,欧洲及英国Azure用户感受到Windows及Linux agents开发作业变得十分慢。微软Azure工程总监Chad Kimes指出,这是因为当天巨大流量导致Azure VM配置错误,造成VM reimage时间增加,进而拉长可用agents的等候时间。微软技术人员发现后做了紧急变更,对Linux agent改使用暂时(ephemeral)OS磁盘,并以扩充Azure VM和使用巢状虚拟化(nested virtualization)解决Windows agents 问题。

三天内共有6,136名客户感受到作业延迟,平均延迟21分钟,有人甚至等了9小时。

但除了技术问题,微软坦承线上网站事件通报也出了状况。情况最严重的第一天,微软方面却迟了快5小时,才向用户通知此事,远远超过10分钟内通知的正规程序。按照Azure的作业流程,Azure系统的自动化工具会在发生事件时,通知指派负责人员(designated responsible individual,DRI)和主要事件管理员(primary incident manager,PIM),后者负责将事件的对外(客户)通讯。当天事件发生时,DRI努力寻找原因及排除问题的同时,PIM却还未起床,直到5小时后美东时间一早,他才发出通报。

微软对此向用户致歉,并承诺做出改善,包括强化运算资源配置失误率及agent reimage时间的监控,并在发现问题时,迅速扩大使用暂时OS磁盘及巢状虚拟化,以解决Linux和Windows agents问题。最后,微软也会改善线上网站对作业延迟事件的通报流程。

2020-04-10 13:53:00

相关文章