Abstract:
Akustik sahne sınıflandırması, bir ses kaydının ait olduğu çevresel ortamın otomatik olarak belirlenmesini amaçlayan, akıllı şehir sistemleri ve bağlam farkındalığına dayalı teknolojilerde yaygın kullanım potansiyeli taşıyan bir makine dinleme problemidir. İnsanlar bulundukları ortamı yalnızca görsel bilgiyle değil, çevreden gelen sesleri dinleyerek de tanıyabilmektedir; akustik sahne sınıflandırması bu yeteneğin hesaplamalı yöntemlerle bilgisayarlara kazandırılmasını hedeflemektedir. Bu tez çalışmasında, Evrişimsel Sinir Ağı (Convolutional Neural Network, CNN) ile Çift Yönlü Uzun Kısa Süreli Bellek (Bidirectional Long Short-Term Memory, BiLSTM) bileşenlerini birleştiren CNN-BiLSTM ve CNNTransformer mimarilerinden çıkarılan derin özniteliklerin, ek bir öğrenilebilir ağırlıklandırma veya dönüşüm uygulanmadan doğrudan ardışık olarak birleştirilmesinin sınıflandırma başarısına katkısı incelenmiştir. Çalışmada Log-Mel öznitelik matrisleri giriş temsili olarak kullanılmış; CNN-BiLSTM ve CNN-Transformer modelleri uçtan uca eğitilerek sırasıyla %88,91 ve %86,85 test doğruluğu elde etmiştir. Bu modellerden çıkarılan 512 ve 256 boyutlu öznitelik vektörlerinin birleştirilmesiyle oluşturulan 768 boyutlu füzyon vektörü, k-En Yakın Komşu (k-Nearest Neighbors, k-NN) sınıflandırıcısıyla %89,29 test doğruluğu ve %88,50 makro F1-skoru sağlamıştır. Çalışmada en yüksek doğruluk füzyon yaklaşımından elde edilmiştir.