Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Duration 21 hours
Course Outline
Core Principles of Audio Classification
- Categorization of sound events: environmental, mechanical, and human-generated
- Exploration of application areas: surveillance, monitoring, and automation
- Distinguishing between audio classification, detection, and segmentation
Audio Data Handling and Feature Extraction
- Overview of various audio file types and formats
- Considerations for sampling rates, windowing, and frame sizes
- Extraction of MFCCs, chroma features, and mel-spectrograms
Data Preparation and Labeling
- Utilizing UrbanSound8K, ESC-50, and bespoke datasets
- Annotating sound events and defining temporal boundaries
- Techniques for dataset balancing and audio augmentation
Developing Audio Classification Models
- Application of convolutional neural networks (CNNs) to audio data
- Comparing raw waveforms versus extracted features as model inputs
- Selection of loss functions, evaluation metrics, and mitigating overfitting
Event Detection and Temporal Localization
- Strategies for frame-based and segment-based detection
- Post-processing methods involving thresholds and smoothing techniques
- Visualization of predictions across audio timelines
Advanced Concepts and Real-Time Processing
- Applying transfer learning in low-data contexts
- Model deployment using TensorFlow Lite or ONNX
- Handling streaming audio and managing latency considerations
Project Development and Application Scenarios
- Architecting a complete pipeline from data ingestion to classification
- Creating proof-of-concepts for surveillance, quality control, or monitoring systems
- Implementing logging, alerting, and integration with dashboards or APIs
Conclusion and Future Directions
Requirements
- A solid grasp of machine learning principles and model training processes
- Proficiency in Python programming and data preprocessing workflows
- Basic knowledge of digital audio fundamentals
Target Audience
- Data scientists
- Machine learning engineers
- Researchers and developers specializing in audio signal processing