変化に気づき、対応と改善につなげる監視へ
DatadogでAWSとアプリケーションの状態を把握し、問題の兆候や異常に気づける環境を整えます。
開発者が対応の必要性を判断し、品質の改善につなげられる監視を目指します。
AWS・アプリケーション
稼働状況・応答時間・エラー
監視ツール
Datadog
- 状態を見える化
- 変化・エラーを通知
- 品質目標の達成状況を表示
開発者
対応・改善を判断
取り組むこと
状態と変化を把握するダッシュボード
普段の状態と変化を把握し、問題が起きたときの調査にも使えます。
- AWSリソースの使用率・空き容量を一つの画面で確認
- リクエスト数・応答時間・エラー率の変化を把握
- 同じ時刻の負荷・エラーの変化を比較
異常に気づくための監視ルールとSlack通知
ダッシュボードを見ていない間も、問題の兆候や異常に気づけます。
- 設定した条件に応じてSlackに通知
- 監視データの途切れを通知
参考:データ欠損時の判定→
エラーを整理し、対応につなげるError Tracking
大量のエラーに埋もれず、開発者が対応すべき問題を見つけやすくします。
- 同種のエラーを一つの問題に集約
- 新規エラーや一定期間の件数超過を開発者へSlackで通知
アプリケーションの品質を確かめるSLO
アプリケーションの品質の目標(SLO)に照らして、改善が必要か判断できます。
- 応答時間・エラー率の目標と達成状況を確認
- 品質の変化と改善効果を把握し、対応の優先順位を判断
監視設定を変更しやすくするTerraform
アプリケーションの変化に合わせて、監視対象や条件を追加・変更しやすくします。
- 監視ルール・SLOの設定をコードで管理
- 共通設定の一括変更で修正漏れを抑制
ご依頼後の進め方
現状と条件を確認する
現状の構成・監視設定と、改善したいことを伺います。通知を受ける担当や対応時間も確認します。
計画を立てる
対応範囲・役割分担・期間を決めます。
実行する
合意した計画に沿って、監視環境を整えます。
状況を確認し改善する
計測と通知の動作を確認し、合意した範囲で設定を調整します。
料金・稼働条件
業務委託(準委任契約)・リモートで対応します。
契約期間や稼働量は、ご希望や案件の状況を伺いながら調整します。
料金は業務内容と稼働量に応じて見積もりします。
監視の整備について相談する
Datadogの導入や、監視・エラー通知・SLOの見直しを検討している方は、現在の環境とお困りの点をお聞かせください。