互联网与媒体行业某大型媒体平台

某大型媒体平台全球链路与应用监控案例

海外分部通过专线连接总部数据中心,需要完善网络可用性告警和关键指标展示。

链路质量分析业务拓扑应用访问分析故障定位历史回溯
业务访问链路从访问到定位的完整证据链
  1. 01用户访问请求与会话
  2. 02网络链路流量与质量
  3. 03业务应用异常线索
  4. 04后端服务定位与回溯

智能全流量分析回溯 · 业务链路示意

01

业务环境

项目背景

随着海外业务增加,该媒体平台在欧洲、美国、亚太、非洲等地区设有分部,并通过专线连接总部数据中心。数据中心作为业务核心,日常运营管理面临较大压力。为保障业务稳定,网络部门计划逐步建立和完善网络可用性告警等专业监控系统,实现相对独立的专业化监控和关键指标集中展示。

02

需要解决的问题

用户痛点

需要实时监控不同网络区域的网络用量和质量;业务系统前后访问关系难以梳理;关键业务出现问题时,无法快速判断是网络、主机、系统还是应用问题;缺少原始流量回溯能力,异常发生后无法还原现场;多媒体云服务需要感知最终用户体验;还需要在故障发生前通过巡检发现数据中心隐患。

01

跨区域网络状态难以统一监控

02

关键业务故障域难判断

03

缺少原始流量回溯

03

围绕真实业务建设

建设内容

01

网络集中监控大屏

02

云环境关键应用关系梳理

03

故障快速定位

04

周期性网络运行报表

05

海外专线链路监控

06

隐患记录

业务问题数据接入异常发现定位回溯
04

来自案例集的实际界面与描述

应用场景

某大型媒体平台应用场景原图,摘自案例集第 33 页
案例集第 33 页 · 场景原图 1
某大型媒体平台应用场景原图,摘自案例集第 33 页
案例集第 33 页 · 场景原图 2
某大型媒体平台应用场景原图,摘自案例集第 34 页
案例集第 34 页 · 场景原图
  1. 01

    网络集中监控大屏

    监控各机房与数据中心专线的网络状态,展示机房和海外专线的流入流出吞吐量、丢包率、网络时延等用量与质量指标,并实时查看各机房和专线的用量、质量排名。

  2. 02

    云环境关键应用关系梳理

    采集、分析真实业务访问流量,输入单个业务名称即可自动得到应用调用逻辑和性能变化,在应用梳理、应用变更等场景中快速、精确地解耦业务。平台自动呈现业务系统间的访问调用关系,为故障排查、安全合规检查、变更比对、机房搬迁和重大业务变更提供数据支持。

  3. 03

    故障快速定位

    针对某应用反复出现访问异常的问题,通过应用监控同时观察网络状态与应用响应趋势,发现网络丢包严重;进一步回溯数据包,确认用户访问时客户侧丢包率较高并导致 TCP 三次握手失败,由此排除数据中心内部原因,转向运营商链路排查。

  4. 04

    周期性网络运行报表

    为相关应用定制周报,帮助用户了解一周内的流量变化趋势,也为运维工作总结提供依据。

  5. 05

    海外专线链路监控

    某区域通信异常时及时告警并快速定位故障域。通过监控可识别海外子机构的严重网络丢包,并继续判断异常设备以及受影响的数据中心服务器。

  6. 06

    隐患记录

    在明显故障出现前记录隐患事件,建立体验指标库和分析优化机制,识别高危端口服务、疑似端口扫描等风险。平台同时配置故障分析场景知识库,定时巡检业务流量突发、网络丢包、应用响应时间过长等问题。

05

从数据到判断

分析过程

  1. 01

    采集跨机房与海外专线数据

  2. 02

    自动呈现业务调用关系

  3. 03

    配置故障分析知识库和周期报告

06

基于案例材料整理

应用价值

01

集中呈现各机房和专线状态

02

通过数据包回溯判断故障是否来自数据中心内部

03

支持海外专线故障域定位

查看原始案例材料

对应案例集第 32–34 页,保留原始章节与图表。

下载案例集