軽量でインストールが簡単なエージェントを使用してサーバーを監視します。60以上のパフォーマンスメトリクス、直感的なダッシュボード、RCA、ITオートメーション、即時アラート機能により、障害やパフォーマンス低下の問題を未然に防ぎます。
サーバー監視エージェントが、3つのデータセンター(1つのプライマリーと2つのセカンダリー)を介してデータを収集・表示する仕組みについて説明します。これらのデータセンターは、データセンター障害が発生した場合でも監視サービスが中断されないよう、異なる場所に設置されています。
PDCで何らかのエラーが発生した場合、ハートビートチェックを介したステータス情報が自動的にプライマリーDRDCに送信されるため、断続的なネットワーク障害による誤報アラートを回避できます。プライマリーDRDCでエラーが発生した場合でも、セカンダリーDRDCがハートビートチェックを受信することで、継続的な監視を保証します。通常の状況でのサーバーシャットダウンは、エージェントからデータセンターに明確に通知されます。
エージェントがユーザーのマシンに正常にインストールされると、PDCへの通信が一方通行のHTTPS接続を使用して開始されます。エージェントは3種類のデータを収集して送信します。
ハートビートチェック:
これは、エージェントがPDCに対して毎分行うステータス情報チェックです。サーバーのアップタイムは、Site24x7がサーバーで実行されているエージェントからハートビートチェックを受信してからの時間によって決定されます。エージェントがPDCと通信できない場合、プライマリーDRDC、次にセカンダリーDRDCへの接続を試みます。
ハートビートチェックが7分間連続して行われない場合、サーバー可用性ウォッチャーがネットワーク通信障害またはシステムクラッシュの可能性についてユーザーにアラートを通知します。この時間間隔は、[管理]→[サーバー監視]→[設定]ページでカスタマイズし、[ハートビートチェックのしきい値設定]に適切な値を設定することもできます。詳細はこちら。
他のデータセンター(AU、IN、CN、EU)の場合、エージェントはPDCと通信し、接続障害が発生した場合はプライマリーDRDCに接続します。他のDCのドメインの完全なリストについては、こちらのドキュメントを参照してください。
ポーリング間隔1分でのデータ収集:
サーバー監視エージェントは毎分データを収集し、それを統合して5分ごとにSite24x7データセンターに送信します。しきい値違反があった場合にのみ、エージェントは即座にデータセンターと通信し、ユーザーにアラートを発生させます。さらに、ポーリング間隔を1分、2分、3分、5分、10分、15分、30分、1時間、3時間、6時間、12時間、1日から設定することもできます。
デバイスメッセージングシステム(DMS):
これは、監視対象サーバーへのリアルタイム通信を保証します。DMSへの通信が行われ、エージェントはユーザーによってトリガーされたいくつかのアクション(プロセスの開始/停止、サービス/プロセスの検出、エージェントのアップグレード、根本原因解析(RCA)、ポート、URL、ファイル、ディレクトリ、イベントログ/syslogチェックの追加など)を実行します。
サーバー監視アーキテクチャー
障害をレポートする前に、Site24x7はネットワークサニティチェックを実行して、自社の内部ネットワークの可用性ステータスを確認します。これは、ダウンしているのが自社のネットワークではなく、対象リソースであることを確認するためです。考えられる障害シナリオとトラブルシューティング手順を確認してください。
Site24x7 Linuxサーバー監視エージェント v19.2.0は、1コアIntel i7プロセッサー、4GB RAM、100GBディスク容量の基本的なLinuxサーバーでリソース消費テストを実施しました。結果は以下の通りです:
同様に、Windowsサーバー監視エージェント v20.6.0は、1コアIntel Xeon Platinum 2.6GHzプロセッサーと4GB RAMを備えた基本的なWindows Server 2019 Datacenterエディションでテストされました。結果は以下の通りです:
エージェントの操作はログに記録され、以下のOS固有の場所に保存されます:
各ログファイルの説明、最大サイズ、数についての詳細はこちらをご覧ください。
サーバー監視エージェントは、Site24x7のWebクライアントの設定ページから自動でアップグレードするか、インストール手順に従って手動でアップグレードします。エージェントのアップグレードプロセスについての詳細はこちらをご覧ください。
エージェントによって実行されるサービスは5つあります:
システムトレイからエージェントのアクションを実行します。システムトレイを開き、Site24x7アイコンを見つけます。右クリックして以下のエージェントアクションを実行します:
エージェントによって実行されるサービスは4つあります:
| Linux OSディストリビューション | サポート対象バージョン |
|---|---|
| Ubuntu | 14.04以降 (x86_64) 16.04以降 (Armv8 64bit) |
| Debian | Debian 7 Wheezy, Debian 8 Jessie, Debian 9 Stretch, 以降 |
| Red Hat | 6以降 |
| CentOS | 6以降 |
| CentOS Stream | 8以降 |
| Rocky Linux | 8以降 |
| Oracle Linux | 6.8以降 |
| AlmaLinux | 8以降 |
| Amazon Linux | 2 |
| SUSE | SUSE 11以降, SLES 12以降, open SUSE 15以降 |
| Fedora | Fedora 26以降 (x86_64) Fedora 27以降 (ARM v8 64bit) |
| OSX | 10以降 |
| FreeBSD | 9以降 |
| IBM AIX | 6.1, 7.1, and 7.2 *** |
| Oracle Solaris | 10以降 (x86_64) *** |
| Raspberry Pi | 2023年2月21日バージョン以降 |
| Mandriva Linux | 21.1以降 |
| CoreOS | 37.20230205.3.0以降 |
| Gentoo Linux | 3.0.31以降 |
| *** 現在表示されるメトリクスが限定的であることを示します。 | |
ターミナルからエージェントのアクションを実行します。エージェントのアクションを実行するには、次のコマンドを実行します。<option>を任意のエージェントアクションコマンドパラメーターに置き換えてください。
rootとしてインストールされたエージェント
非rootとしてインストールされたエージェント
| コマンドパラメーター | 実行されるアクション |
|---|---|
| -ziplogs | Site24x7エージェントのログをアーカイブし、エージェントの一時ディレクトリ(<installed_directory>/site24x7/monagent/temp/)に保存します |
| -newmonitor | 同じUUID/ホスト名のサーバーに対して新しい監視を作成します |
| -createmonitor | Site24x7で削除されたサーバー監視に対して新しい監視を作成します |
| -cpu_sar | CPU監視のためにSARユーティリティを有効にします |
| -version | サーバー監視エージェントのバージョンを表示します |
| -cpu_limit | サーバー監視エージェントが使用できる最大CPU使用率を設定します |
| -mem_limit | サーバー監視エージェントが占有できる最大メモリ容量を設定します |
| <option> --view | 指定されたオプションのレポートを表示します |
| コマンドパラメーター | 実行されるアクション |
|---|---|
| mysql --add_instance | 監視対象のMySQLインスタンスを追加します |
| mysql --update_instance | MySQLインスタンスの認証情報を更新します |
| mysql --remove_instance | 監視からMySQLインスタンスを削除します |
エージェントは監視が必要なすべてのサーバーにダウンロードしてインストールする必要があるため、そのセキュリティ、リソース使用量、および正常なインストールのための前提条件について理解することが重要です。詳細はこちら。
サポートプラットフォームについてはこちらを参照してください。また、一括に100のサーバーにエージェントをインストールできる一括デプロイ機能も利用可能です。各プラットフォームで取得できるパフォーマンスメトリクスについてはこちらを参照してください。
Site24x7プラグインは、DB、アプリケーション、Webサーバー、キャッシュ、メッセージ ブローカーを監視し、データの追跡を行う、優れた手段です。 MySQL、Redis、MongoDB、nginx、HAProxy、ZooKeeper、WordPress、Apache、ゾンビ プロセスなど、60以上の標準プラグインに対応しています。さらに、あらゆるNagiosプラグインがSite24x7で実行可能であるため、オープンソース コミュニティ(英語)でその詳細を確認できます。Linuxの場合は、 PythonかShell、Windowsの場合は、VBScript、PowerShell、バッチ、 DLLによって、カスタム監視を自身で記載することも可能です。
全サーバーのダウンタイムのために詳細な根本原因分析レポートを受信し、単一ダッシュボードでサーバー環境全体を表示して、IT自動化ツールを用いて復旧措置を自動化します。
インストールされているサーバーやアプリケーションで問題が発生していますか?当社のトラブルシューティングのヒントを確認してください。