Get in Touch

Course Outline

Performance Metrics and Evaluation Frameworks

  • Evaluation of latency, throughput, power consumption, and resource utilization
  • Differentiation between system-level and model-level performance bottlenecks
  • Profiling methodologies for inference workloads versus training processes

Performance Profiling on Huawei Ascend Architecture

  • Utilization of CANN Profiler and MindInsight tools
  • Diagnostics for kernel execution and operator performance
  • Analysis of offloading patterns and memory mapping structures

Performance Profiling on Biren GPUs

  • Application of Biren SDK capabilities for performance monitoring
  • Evaluation of kernel fusion, memory alignment protocols, and execution queue management
  • Monitoring of power efficiency and thermal constraints

Performance Profiling on Cambricon MLU Platforms

  • Integration with BANGPy and Neuware performance analysis utilities
  • Kernel-level visibility and interpretation of system logs
  • Synchronization of MLU profiler data with deployment frameworks

Graph and Model-Level Optimization Strategies

  • Implementation of graph pruning and quantization techniques
  • Operator fusion and computational graph restructuring
  • Standardization of input dimensions and batch size optimization

Memory and Kernel Efficiency Enhancements

  • Optimization of memory layout structures and data reuse mechanisms
  • Efficient buffer management across diverse chipsets for government applications
  • Platform-specific kernel tuning methodologies

Cross-Platform Optimization Standards

  • Strategies for performance portability through abstraction layers
  • Development of unified tuning pipelines for multi-chip deployment environments
  • Case study: Optimization of an object detection model across Ascend, Biren, and MLU architectures

Summary and Strategic Next Steps

Requirements

  • Professional background involving the training or deployment pipelines for artificial intelligence models
  • Comprehension of compute architectures utilizing GPUs or MLUs, including model optimization strategies
  • Foundational knowledge of performance profiling utilities and associated metrics

Audience

  • Performance engineering specialists
  • Teams managing machine learning infrastructure for government
  • Architects specializing in AI systems
 21 Hours

Number of participants


Price per participant

Upcoming Courses

Related Categories