ヘルプ 管理 設定プロファイル EC2インスタンスとEBSボリュームのしきい値設定

EC2インスタンスとEBSボリュームのしきい値設定

Site24x7は、さまざまなAWSサービスレベルAPIを活用して、各アベイラビリティゾーンから実行中のすべてのEC2インスタンスとそのアタッチされたEBSボリュームを自動検出し、Site24x7コンソール上の各インスタンスに対してEC2 CloudWatch監視を作成します。

EC2インスタンス(通常またはオートスケーリング)が検出されて監視として追加されると、デフォルトのしきい値プロファイルが割り当てられます。ただし、このプロファイルには事前に入力されたしきい値は設定されていないことに注意してください。デフォルトのプロファイルを編集するか、新しいプロファイルを自分で作成することができます。

監視対象のEC2インスタンスおよびそれにアタッチされたElastic Block Store(EBS)ボリューム用の新しいしきい値プロファイルを作成するには、以下の手順に従ってください。アラート連絡先の作成やアラート設定のカスタマイズについての詳細は、ユーザーとアラートの管理ページを参照ください。

目次

EC2 CloudWatch監視にしきい値プロファイルを作成するには

  1. [管理]→[設定プロファイル]→[しきい値・可用性]とクリックしてください。
  2. しきい値・可用性画面で、[しきい値の追加]を選択します。
  3. 次の情報を指定してください。
    • 監視タイプ:ドロップダウンからEC2インスタンス監視を選択してください。
    • 表示名:対象を特定するラベルとして使います。

EC2インスタンスとEBSボリュームでサポートされているパフォーマンスメトリックが以下に表示されます。所定のフィールドに値を入れ、条件(>、<、>=、<=)を設定して、属性ごとにアラート戦略を決めてください。各フィールドで設定した値によってしきい値が定義されます。
しきい値違反の場合は、EC2インスタンス CloudWatch監視のステータスは、アップからトラブルに変わり、アラートを起動します。しきい値の設定が完了したら、そのままプロファイルを保存します。プロファイルはしきい値・可用性画面に表示されます。

しきい値プロファイルで表示される項目

  • オートスケーリングインスタンス削除の通知
  • [はい]を選択すると、オートスケーリングによってインスタンスが削除された際に通知します。

  • オートスケーリングインスタンス作成の通知
  • [はい]を選択すると、オートスケーリングによってインスタンスが作成された際に通知します。

  • エージェント失敗の通知
  • エージェント失敗の通知トグルボタンは、LinuxやWindowsのエージェントを、監視するEC2インスタンスに展開済みの場合のみ有効となります。

  • ステータスチェック失敗時の通知
  • ハード・ソフトの問題がEC2環境に悪影響を与え始めると、ただちにアラートが発生します。
    デフォルトでは、EC2ステータス確認失敗へのアラート、すなわち、システム確認とインスタンス確認の失敗は、通常インスタンスでも自動スケール インスタンスでも、有効となっています。ステータス確認失敗の際に、どのような通知を希望するかは、トグルボックスでトラブル・ダウンへ動かして設定します。ステータス確認は不要の場合、EC2インスタンスのしきい値プロファイルへ移動し、トグルボタンを「なし」にすれば、本機能はオフとなります。

  • スポットインスタンス削除の通知
  • デフォルトでスポットインスタンスの中断(削除)のアラート通知は無効化されています。このアラートが必要な場合は、設定しているしきい値プロファイルに移動し、この項目で[はい]を選択するかしきい値プロファイルを作成して一括設定してください。

  • スケジュールインスタンス削除の通知
  • デフォルトでスケジュールインスタンスの削除アラートは無効化されています。このアラートが必要な場合は、設定しているしきい値プロファイルに移動し、この項目で[はい]を選択するかしきい値プロファイルを作成して一括設定してください。

  • EMRインスタンス削除の通知
  • デフォルトでEMRクラスタノードマスター、Core、タスクノードを駆動しているEC2インスタンスグループの削除アラートはミュートされています。このアラートが必要な場合は、設定しているしきい値プロファイルに移動し、この項目で[はい]を選択してください。

  • ボリュームステータスチェック失敗の通知
  • [はい]を選択して、EBSデータボリュームのポテンシャルデータに不整合があった際に通知を行います。ボリュームステータスチェックは5分ごとに自動テストされています。このテストが成功すると、ステータスは「OK」と表示されます。失敗するとエラーとなります。

  • GPU接続チェック失敗の通知
  • [はい]を選択して、EC2インスタンスとGPU間の接続に問題があった際に通知します。GPU接続チェックは5分ごとに自動テストされています。このテストが成功すると「アップ」となり、失敗すると設定に基づいて、「ダウン、トラブル、クリティカル」となります。

  • GPU正常性チェック失敗の通知
  • [はい]を選択して、EC2インスタンスに接続されているGPUの正常性チェックに失敗があった際に通知します。GPU正常性チェックは5分ごとに自動テストされています。このテストが成功すると、GPUステータスが「アップ」となり、失敗すると設定に基づいて、「ダウン、トラブル、クリティカル」となります。

  • アクセラレーターステータスチェック失敗の通知
  • [はい]を選択して、EC2インスタンスに接続しているEIアクセラレーターの正常性チェックに失敗があった際に通知を行います。EIアクセラレーター正常性チェックは5分ごとに自動テストされています。このテストが成功すると、EIアクセラレーター正常性ステータスが「アップ」となり、失敗すると設定に基づいて、「ダウン、トラブル、クリティカル」となります。

  • アクセラレーター接続チェック失敗の通知
  • [はい]を選択すると、EC2インスタンスとEIアクセラレーター間の接続に問題があった際に通知を行います。EIアクセラレーター接続チェックは5分ごとに自動テストされています。このテストが成功すると、EIアクセラレーター接続ステータスが「アップ」となり、失敗すると設定に基づいて、「ダウン、トラブル、クリティカル」となります。

  • エージェント情報メールアラートの抑制
  • [エージェント情報メールアラートの抑制]を有効にすることで、EC2インスタンス監視のエージェント情報メールアラートを抑制できます。
    エージェント情報メールは通常、エージェント関連のイベントを通知するために送信されます。これらのメールを受信したくない場合は、このオプションを有効にしてください。有効にすると、Site24x7は選択した監視に対するエージェント情報メールアラートの送信を停止します。

    しきい値設定(EC2属性)

    CPU利用状況、ディスクI/O、ネットワークトラフィックなどの、Amazon EC2インスタンスのパフォーマンスメトリックを監視します。Site24x7は、検出したすべてのEC2インスタンスの標準パフォーマンス情報を収集します。終了すると、サポート対象の属性それぞれに、しきい値をSite24x7のUIで設定できます。

    ボリュームしきい値設定(EBS属性)

    Elastic Block Store ボリュームの、ストレージやI/Oの問題を検知します。アタッチしたEBSボリュームごとに、帯域、遅延、スループットなどのパフォーマンスレポートに、しきい値をセットしてください。

    複数EBSボリュームに、1つのしきい値プロファイルをグローバルに割り当てる

    Elastic Block Store(EBS)ボリュームのしきい値を設定し、EC2インスタンスのしきい値プロファイルにアクセスすると、すべてのEBS属性が包括されるようになります。EC2インスタンスに設定したデフォルトしきい値プロファイルを編集することも、新規しきい値プロファイルを作ることもできます。監視するEC2インスタンスすべてに、このプロファイルを一括割り当てすることも可能です。複数のEBSボリュームを同じECインスタンスにアタッチ済みであれば、ボリューム属性の設定しきい値は、これらすべてに適用されます。

    アタッチしたEBSボリュームごとのしきい値設定

    たとえば、複数のEBSボリュームをアタッチし、ストレージのキャパシティやI/O帯域を増やしたとします。プライマリのボリュームをrootとして利用し、データベースとストレージの負荷に対処するため、2つのボリュームを別途した場合は、EBSボリュームごとに、個別のしきい値設定が必要となることがあります。この場合、前記のEC2インスタンス監視のボリューム タブで、しきい値プロファイルをそれぞれ、ボリュームごとに、作成・適用してください。

    しきい値設定プロファイル(EC2インスタンスの統合監視)

    ユーザーエージェント(LinuxかWindows)を、当社CloudWatch連携で監視対象となっているEC2インスタンスに展開すると、EC2インスタンスの統合監視が始まります。このタイプの監視には、2種類のしきい値プロファイルが関連付けられます。一方は、インスタンス レベルのCloudWatch基本メトリックの、他方は、エージェントが作成するシステムメトリックの関連です。

    しきい値を設定するには、EC2インスタンスの統合監視ページの編集セクションに移動してください。

    1. コンソールの左側ナビゲーションペインで[AWS]を選択し、監視対象のAWSアカウントを選択します。
    2. メニューのドロップダウンから[EC2インスタンス]を選択し、しきい値を設定する統合EC2インスタンス監視を選択します。
    3. ハンバーガーアイコン ハンバーガー アイコン(三枚重ねマーク「≡」) をクリックし、[編集]を選択します。
    4. 設定プロファイルセクションに、2つのしきい値プロファイルフィールドが表示されます。

    「しきい値および可用性プロファイル」には、CloudWatchに関連付けられた標準的なEC2パフォーマンスカウンターが含まれます。ここでは、エージェント障害が発生した場合にアラートを受信するかどうかも設定できます。この通知は、必要に応じて「トラブル」または「ダウン」に設定することが可能です。

    オートスケーリングインスタンスが終了した際に通知を受け取るように設定できます。[オートスケーリングインスタンス停止を通知]のオプションで[はい]を選択してください。これにより、監視が一時停止され、インスタンスが終了したことを知らせるメールアラートが送信されます。

    詳細しきい値設定

    条件とアラート戦略の設定により、しきい値違反の検証も可能となります。たとえば、インスタンスのCPU利用率が95%を超えたとします。しかし、ネットワーク トラフィックの突発的な一時増で、CPU利用率が、95%を超えるのはありうることです。このような短期的な効果については、ただちにアラートをあげる必要もなく、ネットワークの鎮静にあわせてCPU利用も減るものと予想されます。この例では、アラート戦略をポーリング回数や平均的持続に設定し、CPU利用の上昇が、恒常的なものが短期的なものかを判断することができます。

    詳細しきい値設定(戦略)

    ポーリング回数は、しきい値違反を検証するためのデフォルトの戦略として機能します。指定したしきい値戦略に複数の条件(=、>、 <、 >=、 <=)を適用して、しきい値違反を検証できます。以下のいずれかのしきい値戦略に適用された条件が満たされると、監視のステータスが「トラブル」に変化します。

    • ポーリング回数でのしきい値条件確認:しきい値に適用する条件が、指定の「ポーリング回数」を通じて妥当する場合、監視ステータスは、トラブルに変わります。
    • ポーリング回数での平均値:属性値平均が、指定のポーリング回数にわたり、継続してしきい値への適用条件を満たす場合、監視ステータスは、トラブルに変わります。
    • 指定期間での条件確認(分):しきい値への指定条件が、設定期間を通じて、すべてのポーリングについて継続して妥当の場合、監視ステータスは、トラブルに変わります。
    • 指定期間での平均値(分):属性値平均が、設定期間について、しきい値への適用条件を継続して満たす場合、監視ステータスは、トラブルに変わります。

    デフォルトでは、複数のポーリングチェックプランが適用されることはありません。適用されるプランがなければ、しきい値違反は、ポーリング1回で判別します。
    プラン3「指定期間での条件確認」や4「指定期間での平均値」でしきい値違反を確実に検出するには、チェック間隔を最低2回カバーするように、期間を指定する必要する必要があります。