Sensors
Spatial-Temporal Relation Enhancement for Speech Emotion Recognition from Acoustic Signals Using Fibonacci Encoding with Diverse Feature Fusion
Speech emotion recognition (SER) infers affective states from speech signals, but positional encoding for acoustic tokens remains underexplored in Transformer-based SER. Existing models often reuse encodings designed for text and do not explicitly account for the different sequential and two-dimensional structures of acoustic representations. We propose Fibonacci Position Embedding (FPE) and Fibonacci Target Shutter (FTS). FTS constructs overlapping candidate-index sets over time–frequency token grids, and FPE samp …