クラウド化・マイクロサービス化が進み、システムの構成はますます複雑になっています。監視対象が増えるほどアラートの数も膨大になり、従来のように人が一つひとつ確認して判断する運用監視は限界を迎えつつあります。こうした課題を背景に注目されているのが「AIOps」です。
ここでは、AIOpsとは何か、その仕組みと、なぜ今求められているのかを解説します。
- AIOpsとは何か、注目される背景
- AIOpsの仕組み・活用される技術
- AIOpsが求められている理由
1.AIOpsとは
AIOpsとは、「Artificial Intelligence for IT Operations」の略で、AI・機械学習を活用してIT運用(監視・障害対応・分析等)を自動化・高度化する取り組みを指します。
従来の運用監視は、人がダッシュボードやアラートを確認し、経験と勘をもとに異常の有無や対応の要否を判断するスタイルが中心でした。しかしシステムの規模が大きくなるほど、この方式では監視すべき対象とアラートの量が人の処理能力を超えてしまいます。
AIOpsは、こうした膨大な運用データの処理をAIに任せることで、人による判断・対応が必要な部分に集中できるようにする考え方です。
2.AIOpsの仕組み
AIOpsは、いくつかの要素が組み合わさって機能します。
データ収集
ログ、メトリクス(CPU使用率やレスポンスタイムなどの数値データ)、トレース(処理の流れを追跡した記録)など、システムから生成される大量の運用データを収集します。
異常検知
機械学習によって「普段の正常な状態」のパターンを学習し、そこから外れる挙動を自動的に検知します。あらかじめ決められたしきい値を超えたかどうかだけで判断する従来型の監視と異なり、日々変化する正常値の傾向そのものを学習できる点が特徴です。
相関分析・根本原因分析
システムの規模が大きくなると、一つの障害が連鎖的に大量のアラートを発生させることがあります。AIOpsは、関連するアラート同士を自動的に紐づけ、根本原因がどこにあるのかを特定する助けになります。
自動化・自己修復
検知した問題に対して、担当者への通知やチケットの自動起票、あらかじめ定義された範囲内での自動対応までを行う仕組みも含まれます。
3.AIOpsが求められている理由
システム構成の複雑化
クラウド化・マイクロサービス化により、一つのサービスが多数の小さなコンポーネントで構成されるようになりました。監視すべき対象が増えるほど、アラートの量も比例して増加します。
24時間365日の安定運用へのプレッシャー
サービス停止が事業に与える影響が大きくなる中、障害を早期に検知し、迅速に対応する体制が常に求められています。人手だけでこれを維持し続けるのは負担が大きくなっています。
アラート疲れの解消
大量のアラートが日常的に発生する環境では、担当者が重要な異常を見逃してしまう「アラート疲れ(アラートファティーグ)」が課題になります。AIOpsは、重要度の低いアラートを絞り込み、本当に対応が必要なものに注意を向けやすくします。
事後対応から予防的な運用への転換
障害が起きてから対応する従来のスタイルから、予兆の段階で検知し未然に防ぐ運用への転換ニーズも、AIOpsが注目される背景の一つです。
4.AIOpsに関わる技術の動向
近年は、既存の監視ツールやログ管理ツールにAI機能を組み込む動きが広がっています。異常検知や根本原因分析といった機能が、監視基盤の中に標準的な機能として統合されつつある点は、業界全体の一般的な傾向として押さえておくとよいでしょう。
また、クラウド事業者各社も、自社のクラウド環境向けにAIを活用した運用支援サービスを提供する動きを強めています。具体的な製品・サービスの機能や特徴は変化が速い分野のため、導入を検討する際は各社の最新情報を確認することをおすすめします。
5.まとめ
AIOpsとは、AI・機械学習の力を借りて、複雑化するIT運用を効率的かつ的確に行うための取り組みです。データ収集・異常検知・根本原因分析・自動化という一連の仕組みを通じて、増え続けるアラートへの対応や、予防的な運用への転換を支えます。
クラウド化・マイクロサービス化がさらに進むと予想される中、AIOpsはIT運用のあり方を考えるうえで欠かせない概念になっていくと考えられます。
