Get in Touch

Course Outline

Introduction to Agentic AI for Operations

  • The transition from static runbooks to reasoning agents in IT automation
  • Agent components: reasoning loops, tool utilization, memory management, and planning
  • Criteria for determining when to automate versus retaining human oversight

Agent Frameworks and Architectures

  • Single-agent patterns: ReAct, Plan-and-Execute, and tool-calling loops
  • Multi-agent architectures: supervisor, hierarchical, and swarm models
  • Evaluation of frameworks: LangGraph, CrewAI, AutoGen, and custom implementations for government systems
  • Development of initial operational agents: monitoring queries, diagnosis, and proposal generation

Tool Integration for IT Operations

  • Integration with monitoring platforms via Prometheus, Grafana, Datadog, and PagerDuty APIs
  • Log analysis capabilities using Elasticsearch, Loki, and Splunk integrations
  • Infrastructure management through kubectl, Terraform, and Ansible agent actions
  • Design of secure tool interfaces emphasizing parameter validation and idempotency

Incident Response Automation

  • Automated incident triage including severity classification and routing protocols
  • Generation of root cause hypotheses and evidence collection
  • Automated remediation actions: restart, scale, rollback, and failover procedures
  • Development of incident runbook agents with progressive autonomy levels

Safety, Guardrails, and Human-in-the-Loop

  • Action classification system: read-only, low-risk, high-risk, and destructive categories
  • Approval gates and escalation policies for critical government operations
  • Guardrail patterns: action allowlists, blast radius limitations, and rollback guarantees
  • Audit trails and decision provenance to ensure compliance with regulatory standards

Multi-Agent Orchestration for Complex Incidents

  • Coordination of specialist agents: triage, diagnosis, and remediation functions
  • Inter-agent communication and shared context management protocols
  • Conflict resolution strategies for contradictory agent proposals
  • End-to-end major incident simulation demonstrating multi-agent response capabilities

Observability and Evaluation

  • Tracing agent reasoning chains for debugging, auditing, and accountability
  • Evaluation of decision quality metrics: precision, recall, and time-to-resolution
  • Feedback mechanisms: learning from operator overrides and operational outcomes
  • Cost tracking and token economics for efficient government use of operational agents

Production Deployment and Operations

  • Deployment of agents as services via APIs, webhooks, and scheduled jobs
  • Gradual autonomy rollout: transitioning from shadow mode to full auto-remediation
  • Fallback procedures for agent failures to maintain system reliability
  • Development of business cases and measurement of ROI for autonomous operations in the public sector

Requirements

  • Demonstrated proficiency in IT operations, DevOps, or Site Reliability Engineering (SRE) methodologies.
  • Competence in Python scripting and the utilization of REST APIs.
  • Fundamental knowledge of Large Language Model (LLM) functionalities and prompt engineering techniques.

Audience

  • SRE and DevOps practitioners assessing AI-driven automation solutions for government systems.
  • Platform engineers responsible for developing resilient, self-healing infrastructure.
  • IT operations leadership evaluating agentic AI capabilities for incident response and management.
 14 Hours

Number of participants


Price per participant

Upcoming Courses

Related Categories