Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Course Outline
Introduction to Agentic AI for Operations
- The transition from static runbooks to reasoning agents in IT automation
- Agent components: reasoning loops, tool utilization, memory management, and planning
- Criteria for determining when to automate versus retaining human oversight
Agent Frameworks and Architectures
- Single-agent patterns: ReAct, Plan-and-Execute, and tool-calling loops
- Multi-agent architectures: supervisor, hierarchical, and swarm models
- Evaluation of frameworks: LangGraph, CrewAI, AutoGen, and custom implementations for government systems
- Development of initial operational agents: monitoring queries, diagnosis, and proposal generation
Tool Integration for IT Operations
- Integration with monitoring platforms via Prometheus, Grafana, Datadog, and PagerDuty APIs
- Log analysis capabilities using Elasticsearch, Loki, and Splunk integrations
- Infrastructure management through kubectl, Terraform, and Ansible agent actions
- Design of secure tool interfaces emphasizing parameter validation and idempotency
Incident Response Automation
- Automated incident triage including severity classification and routing protocols
- Generation of root cause hypotheses and evidence collection
- Automated remediation actions: restart, scale, rollback, and failover procedures
- Development of incident runbook agents with progressive autonomy levels
Safety, Guardrails, and Human-in-the-Loop
- Action classification system: read-only, low-risk, high-risk, and destructive categories
- Approval gates and escalation policies for critical government operations
- Guardrail patterns: action allowlists, blast radius limitations, and rollback guarantees
- Audit trails and decision provenance to ensure compliance with regulatory standards
Multi-Agent Orchestration for Complex Incidents
- Coordination of specialist agents: triage, diagnosis, and remediation functions
- Inter-agent communication and shared context management protocols
- Conflict resolution strategies for contradictory agent proposals
- End-to-end major incident simulation demonstrating multi-agent response capabilities
Observability and Evaluation
- Tracing agent reasoning chains for debugging, auditing, and accountability
- Evaluation of decision quality metrics: precision, recall, and time-to-resolution
- Feedback mechanisms: learning from operator overrides and operational outcomes
- Cost tracking and token economics for efficient government use of operational agents
Production Deployment and Operations
- Deployment of agents as services via APIs, webhooks, and scheduled jobs
- Gradual autonomy rollout: transitioning from shadow mode to full auto-remediation
- Fallback procedures for agent failures to maintain system reliability
- Development of business cases and measurement of ROI for autonomous operations in the public sector
Requirements
- Demonstrated proficiency in IT operations, DevOps, or Site Reliability Engineering (SRE) methodologies.
- Competence in Python scripting and the utilization of REST APIs.
- Fundamental knowledge of Large Language Model (LLM) functionalities and prompt engineering techniques.
Audience
- SRE and DevOps practitioners assessing AI-driven automation solutions for government systems.
- Platform engineers responsible for developing resilient, self-healing infrastructure.
- IT operations leadership evaluating agentic AI capabilities for incident response and management.
14 Hours