ヘルプ 管理 しきい値・可用性 サーバー監視のしきい値・可用性

サーバー監視のしきい値・可用性

Site24x7アカウントにサーバー監視の追加が正常に完了したら、しきい値と可用性プロファイルを追加します。これにより、アラートエンジンが特定のリソースを重大またはダウンと判定するかどうかを判断できるようになります。
誤報を減らすために、ダウンタイムルールを設定してください。

しきい値プロファイルの設定時には、希望する属性にIT自動化を割り当てることが可能です。しきい値を超えた場合、是正のための自動化処理が実行され、手動での介入なしに問題を解決できます。サーバー監視ごとに「n」個の自動化処理を割り当てることができ、属性ごとに最大5つの是正自動化処理を設定できます。

しきい値・可用性プロファイルの追加

  1. [管理]→[設定プロファイル]→[しきい値・可用性]の順に移動します。
  2. しきい値・可用性画面の[しきい値プロファイルの追加]をクリックしてください。
    また、[サーバー]→[サーバー監視]→[サーバー]の順に選択し、サーバー監視をクリックして、表示名の横にあるハンバーガーアイコンにカーソルを合わせ、[編集]→[設定プロファイル]→[しきい値と可用性]の横にある鉛筆アイコンをクリックして操作することもできます。
  3. サーバー監視のしきい値・可用性を追加するには、次の情報を指定します。
    • 監視タイプ:ドロップダウンからサーバー監視を選択してください。
    • 表示名:対象を特定するラベルとして使います。
  4. しきい値タイプ:一定しきい値とAIベースしきい値から選択できます 。しきい値を設定できるメトリックについては、以下のセクションをご参照ください。
    • 一定しきい値:ドロップダウンメニューから、しきい値を設定したいメトリックを選択してください。 各メトリックについて、単位に応じた値を入力し、しきい値条件(<、<=、=、>、または>=)および監視状態(通知対象として)を設定してください。これらのしきい値条件が違反された場合、アラートが送信されます。
    • AI ベースしきい値:AIベースしきい値は、アノマリ検知機能を使用して異常な急上昇を追跡し、それに応じて更新される動的なしきい値を提供します。AIベースのしきい値を選択する場合は、関連する異常重要度とステータスを選択してください。
  5. 詳細しきい値設定(作戦)

    ポーリング回数はしきい値違反を確認する際に、デフォルトの作戦として利用します。しきい値違反の判定には、複数条件 (>、<、>=、<=)を、対象しきい値作戦へ適用することができます。下記しきい値作戦のいずれかでもtrueであれば、監視のステータスは「トラブル」に変わります。

    • ポーリング回数でのしきい値条件確認:しきい値に適用する条件が、指定の「ポーリング回数」を通じて妥当する場合、監視ステータスは、トラブルに変わります。
    • ポーリング回数での平均値:属性値平均が、指定のポーリング回数にわたり、継続してしきい値への適用条件を満たす場合、監視ステータスは、トラブルに変わります。
    • 指定期間での条件確認(分):しきい値への指定条件が、設定期間を通じて、すべてのポーリングについて継続して妥当の場合、監視ステータスは、トラブルに変わります。
    • 指定期間での平均値(分):属性値平均が、設定期間について、しきい値への適用条件を継続して満たす場合、監視ステータスは、トラブルに変わります。

    デフォルトでは、複数のポーリングチェックプランが適用されることはありません。適用されるプランがなければ、しきい値違反は、ポーリング1回で判別します。

    プラン3「指定期間での条件確認」や4「指定期間での平均値」でしきい値違反を確実に検出するには、当該の監視について、チェック間隔を最低2回カバーするように、期間を指定する必要する必要があります。
  6. [保存]をクリックしてください。 サーバー監視むけに作成したしきい値・可用性プロファイルは、既存のものとあわせ、しきい値・可用性画面に、自動的に表示されます。

サポートされているメトリック

  • 一般的なしきい値
    • プロセス/サービスがダウンした際に通知する:プロセス/サービスがダウンした際に通知を受け取るには、このトグルボタンをオンにしてください。「トラブル」、「ダウン」、または「重大」のアラートで通知を受け取るかを選択できます。また、この属性に自動化を割り当てることも可能です。
    • リソースチェックに失敗した際のアラート:リソースチェックに失敗した際にアラート(「トラブル」、「ダウン」、「クリティカル」)を発行するには、トグルボタンを有効にしてください。
    • データ収集が行われていない場合の通知:サーバーおよびアプリケーションのパフォーマンスデータが収集されていない場合、「ダウン」、「トラブル」、または「クリティカル」ステータスで通知を受け取るには、サーバー監視設定ページで時間しきい値を設定してください。
    • ディスクパーティションがダウンした際に通知する: パーティションがサーバーから削除された際にアラート(ダウン)を受け取りたい場合は、「はい」に切り替えてください 。
    • ネットワークアダプタがダウンしている場合:ネットワークアダプタがダウンした際に「トラブル」アラートを発動させるには、このトグルボタンを有効にしてください。
    • CPU使用率のしきい値:CPU使用率が設定されたしきい値を超えた場合、「トラブル」または「クリティカル」ステータスで通知を受け取ることができます。
    • CPU使用率(%):CPU使用率が設定されたしきい値を超えた場合、「トラブル」または「重大」ステータスで通知を受け取ります。
    • コアごとのCPU使用率のしきい値:コアごとのCPU使用率が設定されたしきい値を超えた場合、「トラブル」または「重大」というステータスで通知を受け取ります。
    • メモリ使用率のしきい値:メモリ使用率が設定されたしきい値を超えた場合、「トラブル」または「重大」というステータスで通知を受け取ります。
    • ディスク使用率のしきい値:ディスク使用率が設定されたしきい値を超えた場合、「トラブル」または「重大」というステータスで通知を受け取ります。
    • パーティションのディスク使用率のしきい値:パーティションのディスク使用率が設定されたしきい値を超えた場合、「トラブル」または「クリティカル」のステータスで通知されます。これは、バイト、KB、MB、GB、TB、およびパーセンテージ単位で設定可能です。
    • プロセスのCPU使用率のしきい値:監視対象プロセスの CPU 使用率が設定されたしきい値を超えた場合、「トラブル」または「クリティカル」というステータスで通知されます。
    • プロセスのメモリ使用率のしきい値:監視対象プロセスのメモリ使用率が設定されたしきい値を超えた場合、「トラブル」または「重大」というステータスで通知されます。
    • プロセスのスレッド数しきい値:監視対象プロセスのスレッド数が設定されたしきい値を超えた場合、「トラブル」または「クリティカル」というステータスで通知されます。
    • プロセスのハンドル数しきい値:監視対象プロセスのハンドル数が設定されたしきい値を超えた場合、「トラブル」または「クリティカル」というステータスで通知されます。
    • ネットワーク帯域幅超過:帯域幅の使用率が設定値を超えた場合に通知を受け取ります。
    • ネットワークエラーパケットのしきい値:ネットワークエラーパケットが設定されたしきい値を超えた場合、ステータス「トラブル」または「クリティカル」で通知を受け取ります。
    • スワップメモリ使用率のしきい値:スワップメモリの使用量が設定値を超えた場合に通知を受け取ります。
    • ディスクの読み取り:ディスクから読み取られたデータのバイト数が設定値を超えた場合、「トラブル」または「重大」というステータスで通知されます。
    • ディスク書き込み:ディスクに書き込まれたデータのバイト数が設定値を超えた場合、「トラブル」または「重大」というステータスで通知を受け取ります。
    • ディスク I/O:読み取り/書き込みまたは入出力操作の合計が設定値を超えた場合、「トラブル」または「重大」のステータスで通知を受け取ります。
    • ディスクのアイドル率:ディスクがアイドル状態にある割合が設定値を超えた場合に、「トラブル」または「重大」のステータスで通知を受け取ります。
    • ディスクのビジー率:ディスクがビジー状態にある時間が設定値を超えた場合、「トラブル」または「クリティカル」のステータスで通知されます。
    • サーバーの稼働時間:サーバーの稼働時間が設定値を超えた場合、「トラブル」または「重大」というステータスで通知されます。これは、ms、秒、分、時間、日単位で設定できます。
    • IPアドレス:これは文字列属性です。指定されたIPアドレスが設定値と一致する場合、または一致しない場合に、「トラブル」または「クリティカル」のステータスで通知を受け取ります。「contains」および「doesn't contain」の条件では、コンマで区切って複数のアドレスを指定できます。「On Change」の条件では、値を設定することはできません。また、「Send Alert」を選択することも可能で、この場合、監視のステータスを変更せずにアラートのみが送信されます。
    • RAM容量:これは文字列属性です。RAM容量が設定値と一致する場合、または一致しない場合に、「トラブル」または「クリティカル」のステータスで通知を受け取ります。
    • システムのアイドル率:サーバーがアイドル状態で過ごした時間の割合が設定値を超えた場合、「トラブル」または「クリティカル」のステータスで通知されます。
    • 実行中のプロセス数しきい値:サーバー上で実行中のプロセスの総数が、設定されたしきい値を超えた場合、「トラブル」または「クリティカル」のステータスで通知されます。
    • 平均ディスクキュー長:平均ディスクキュー長が設定されたしきい値を超えた場合、「トラブル」または「クリティカル」ステータスで通知されます。
  • Windows固有の属性(バージョン15.3.1以上で対応)
    • サービス総数:サーバーで稼働しているサービスの総数がしきい値を超えると、ステータス トラブルを通知します。
    • プロセッサーキュー長の超過(Length、要素数):CPUリソースを待機しているスレッドの数が、しきい値を超えると、ステータス トラブルを通知します。
  • Linux固有の属性(バージョン14.7.0以上で対応)
    • システム負荷(1分平均)のしきい値:システム負荷の1分平均値が設定値を超えた場合、「トラブル」または「重大」というステータスで通知されます。
    • システム負荷(5分平均)のしきい値:システム負荷の5分平均が設定値を超えた場合、「トラブル」または「重大」というステータスで通知を受け取ります。
    • システム負荷(15分平均)のしきい値: システム負荷の 15 分平均が設定値を超えた場合、「トラブル」または「重大」というステータスで通知されます。
    • 総プロセス数しきい値:プロセスの総数が設定値を超えた場合、「トラブル」または「重大」のステータスで通知されます。
    • ブロックされたプロセス数のしきい値:リソースを待機しているプロセスの数が設定されたしきい値を超えた場合、「トラブル」または「クリティカル」というステータスで通知されます。
    • CPUユーザースペースのしきい値:ユーザープロセスに費やされる CPU 使用率が設定値を超えた場合、「トラブル」または「重大」というステータスで通知されます。
    • CPUハードウェア割り込みのしきい値:ハードウェア割り込みの処理に費やされるCPU使用率が設定値を超えた場合、「トラブル」または「クリティカル」のステータスで通知されます。
    • CPUアイドルしきい値:CPU がアイドル状態で費やされる割合が設定値を超えた場合、「トラブル」または「重大」というステータスで通知されます。
    • CPUソフトウェア割り込みのしきい値: ソフトウェア割り込みの処理に費やされる CPU 使用率が設定値を超えた場合、ステータス「トラブル」または「クリティカル」で通知されます。
    • CPU優先度しきい値:低優先度のプロセスを処理している CPU 使用率が設定値を超えた場合、「トラブル」または「クリティカル」のステータスで通知されます。
    • CPU待機しきい値: I/O 操作を待機している CPU 使用率が設定値を超えた場合、「トラブル」または「クリティカル」のステータスで通知されます。
    • CPUスティールしきい値:ハイパーバイザーホストが他の仮想マシンに使用するために奪った時間が、設定値を超えた場合に、「トラブル」または「クリティカル」のステータスで通知されます。
    • CPUシステムしきい値:システムプロセスに費やされる CPU 使用率が設定値を超えた場合、「トラブル」または「クリティカル」というステータスで通知を受け取ります。

しきい値・可用性プロファイルの編集

  1. 編集するプロファイルをクリックしてください。
  2. 変更するパラメーターを、しきい値プロファイルの追加画面で編集してください。
  3. [保存]をクリックしてください。

しきい値・可用性プロファイルの削除

  1. 削除するしきい値・可用性画面で削除するプロファイルをクリックしてください。
  2. これにより、しきい値プロファイルの編集画面へと移動します。
  3. [削除]をクリックしてください。

関連記事: