変化に気づき、対応と改善につなげる監視へ

DatadogでAWSとアプリケーションの状態を把握し、問題の兆候や異常に気づける環境を整えます。
開発者が対応の必要性を判断し、品質の改善につなげられる監視を目指します。

AWS・アプリケーション

稼働状況・応答時間・エラー

監視ツール

Datadog

  • 状態を見える化
  • 変化・エラーを通知
  • 品質目標の達成状況を表示

開発者

対応・改善を判断

取り組むこと

状態と変化を把握するダッシュボード

普段の状態と変化を把握し、問題が起きたときの調査にも使えます。

  • AWSリソースの使用率・空き容量を一つの画面で確認
  • リクエスト数・応答時間・エラー率の変化を把握
  • 同じ時刻の負荷・エラーの変化を比較

異常に気づくための監視ルールとSlack通知

ダッシュボードを見ていない間も、問題の兆候や異常に気づけます。

  • 設定した条件に応じてSlackに通知
  • 監視データの途切れを通知

エラーを整理し、対応につなげるError Tracking

大量のエラーに埋もれず、開発者が対応すべき問題を見つけやすくします。

  • 同種のエラーを一つの問題に集約
  • 新規エラーや一定期間の件数超過を開発者へSlackで通知

アプリケーションの品質を確かめるSLO

アプリケーションの品質の目標(SLO)に照らして、改善が必要か判断できます。

  • 応答時間・エラー率の目標と達成状況を確認
  • 品質の変化と改善効果を把握し、対応の優先順位を判断

監視設定を変更しやすくするTerraform

アプリケーションの変化に合わせて、監視対象や条件を追加・変更しやすくします。

  • 監視ルール・SLOの設定をコードで管理
  • 共通設定の一括変更で修正漏れを抑制

ご依頼後の進め方

  1. 現状と条件を確認する

    現状の構成・監視設定と、改善したいことを伺います。通知を受ける担当や対応時間も確認します。

  2. 計画を立てる

    対応範囲・役割分担・期間を決めます。

  3. 実行する

    合意した計画に沿って、監視環境を整えます。

  4. 状況を確認し改善する

    計測と通知の動作を確認し、合意した範囲で設定を調整します。

料金・稼働条件

業務委託(準委任契約)・リモートで対応します。
契約期間や稼働量は、ご希望や案件の状況を伺いながら調整します。
料金は業務内容と稼働量に応じて見積もりします。

監視の整備について相談する

Datadogの導入や、監視・エラー通知・SLOの見直しを検討している方は、現在の環境とお困りの点をお聞かせください。

相談する