我们有什么?
应用维度
1.我们有多少应用系统?2.应用系统架构是什么样子?依赖哪些服务?3.应用程序包部署在哪里?4.应用系统A到底有多少台服务器?
资源维度
1.有多少中间件、中间件集群?2.有多少数据库、数据库集群?3..有多少Hadoop服务?4.有多少小型机、PC服务器、刀片服务器、网络设备?
机房维度
1.我们的资源位置在哪?2.机房里放了多少设备?3.是否还有位置存放新的设备?4.机房各区域设备归属哪些业务系统?
管理维度
1.我们们到底有多少资源需要维护?2.谁负责维护?3.资源维护的责任边界是否清晰?4.是否存在职责交叉或无人接管的资产?
发生了什么?
发布管理
1.我们的应用最近是否做过版本发布?2.应用相关的配置是否发现过变动?3.发布 / 配置变更是否引发过业务异常?
变更控制
1.我们的设备最近是否做过变更?2.工单涉及的变更到底动了哪几个设备?3.影响到上层哪些应用系统?
事件管理
1.我们的资源是否都有监控?2.上个月事件最多的 10 台机器是哪几个?3.事件是否对上层业务造成了影响?
维保与容量管理
1.哪一些软件与设备已经过保?2.设备是否都需要购买维保?3.核心应用容量使用情况如何?
可以做什么?
智能运维
1.告警是否可以根据资源关系进行压缩?2.能否让 AI 智能例行巡检发现并处理问题?3.能不能由 AI 助手告诉用户当前 IT 和业务状态?4.告警是可以根据资源关系推荐根因?,甚至有条件的处理
架构评估
1.哪一些业务组件是我们的架构的薄弱点?2.未来的重点业务系统架构加固与改善的重点是什么?3.未来的网络架构加固与改善的重点是什么?4.架构风险是否会随业务迭代持续放大?
隐患分析
1.每一个组件类中,事件有哪一些分布特性?2.比如中间件的哪一个版本事件率最高?3.终端机器的事件率与使用年限有没有函数关系?4.与品牌或厂商有没有相关性?
健康度与容量
1.核心应用是否需要扩容?2.是否存在非核心应用可以缩容?3.上层服务健康度的下降到底是由哪一些组件决定的?4.健康度分析中,哪些告警阈值值得重点配置?
