Salta al contenuto
Note per Studenti Qualità del servizio (QoS) e qualità dell'esperienza (QoE)

Qualità del servizio (QoS) e qualità dell'esperienza (QoE)

In questa pagina 7

Finora (note Digitalizzazione dei segnali multimediali - campionamento, quantizzazione e binarizzazioneLa conversione analogico-digitale (ADC) ha tre passi: campionamento $s_c(n)=s(nT_c)$, quantizzazione su $L=2^m$ livelli, binarizzazione dell'indice in $m$ bit; il bit-rate vale $R=F_c\log_2L$. Per il teorema di Shannon un segnale a banda limitata $f_M$ si ricostruisce senza errore se $F_c\ge2f_M$ (criterio di Nyquist), altrimenti c'è aliasing; per questo prima del campionatore c'è un filtro passa-basso. La quantizzazione uniforme di passo $\Delta=\frac{2A}{L}$ è irreversibile, con errore massimo $\frac\Delta2$ e $\mathrm{MSE}=\frac{\Delta^2}{12}$; la qualità si misura con MSE e $\mathrm{PSNR}=10\log_{10}\frac{(2^b-1)^2}{\mathrm{MSE}}$. In ricezione il bit mapper ricostruisce i valori e l'interpolazione con un nucleo $h$ (sample and hold, lineare, cubica, sinc troncato) riporta il segnale al tempo continuo.Digitalizzazione dei segnali multimediali - campionamento, quantizzazione e binarizzazione →, Metriche e prestazioni di rete per i servizi multimedialiUna rete è una pila di livelli: ogni livello offre un servizio al superiore tramite un'interfaccia e dialoga con il livello pari con un protocollo; il pacchetto di un livello è il payload del livello inferiore ($\mathrm{PDU}n=\mathrm{PCI}n+\mathrm{SDU}n$), con efficienza $\eta=\frac{|\mathrm{SDU}n|}{|\mathrm{PDU}n|}$. Metriche: bit-rate $R_0$ (livello fisico) $\ge$ throughput $S$ $\ge$ goodput (throughput a lungo termine a livello applicazione). Ritardo nodale $d=d{proc}+d{queue}+d{trans}+d{prop}$ con $d{trans}=\frac LR$ e $d_{prop}=\frac xc$; ritardo end-to-end = somma dei nodali; jitter = variabilità del ritardo; BDP $=S\cdot\mathrm{RTT}$ (con il bit-rate minimo del percorso). Affidabilità: nel canale binario simmetrico $\mathrm{PER}=1-(1-\varepsilon)^L$ e $P(\ell)=\binom L\ell\varepsilon^\ell(1-\varepsilon)^{L-\ell}$; codici di canale $R=\frac kn$, parità, Hamming, interleaving per i burst; perdite per errori o congestione, $\mathrm{PDR}=1-P_{\text{LOSS}}$.Metriche e prestazioni di rete per i servizi multimediali →) si sono misurati parametri tecnici: bit-rate, ritardo, perdite, MSE. Ma l'obiettivo di un servizio multimediale è che l'utente sia soddisfatto. Questa nota distingue la qualità del servizio (QoS) dalla qualità dell'esperienza (QoE), e presenta i metodi per misurare la qualità di immagini e video: test soggettivi con osservatori umani e metriche oggettive calcolabili da un algoritmo.

1. QoS: qualità del servizio

Definizione (QoS, ITU-T E.800, 2008). La QoS è l'insieme delle caratteristiche di un servizio di telecomunicazioni che influiscono sulla sua capacità di soddisfare le esigenze dichiarate e implicite dell'utente del servizio.

In altre parole: un insieme di tecnologie di rete e strumenti di misura che consentono alla rete di garantire risultati prevedibili e misurabili. Si misura con gli indici di prestazione già visti: throughput, ritardo/latenza, jitter, perdita di pacchetti; più la disponibilità del servizio (probabilità che il server non sia disponibile, per esempio perché sovraccarico) e l'affidabilità (probabilità che il servizio diventi indisponibile durante l'uso). La QoS è particolarmente importante per il traffico ad alto bit-rate e in tempo reale (VoIP, videoconferenze, video on demand), molto sensibile a latenza e throughput.

Limiti della QoS. Si concentra sui servizi di telecomunicazioni; si occupa degli aspetti prestazionali dei sistemi fisici; ha un approccio molto orientato alla tecnologia (analisi, misure empiriche, simulazioni). Contesto d'uso e caratteristiche dell'utente non sono affrontati in modo sistematico.

2. QoE: qualità dell'esperienza

Definizione (QoE). La QoE è la qualità del servizio percepita dall'utente. La definizione ufficiale (Qualinet): "il grado di gradimento o fastidio dell'utente di un'applicazione o servizio".

Che cosa conta dipende dal servizio:

  • trasferimento dati (FTP, download): tempo di risposta rapido, nessuna caduta di connessione, nessun errore nei dati;
  • voce: nessuna caduta di chiamata, nessuna interruzione, livello costante, buona qualità della voce;
  • video: immagine di alta qualità, video fluido, nessun blocco, nessun glitch, sincronia voce-immagine.

È difficile da misurare perché gli utenti sono diversi tra loro, vanno considerate le condizioni del contesto, e l'applicazione ha un impatto.

2.1 I fattori che influenzano la QoE: il modello ARCU

La QoE è funzione di cinque "spazi" (modello ARCU, Skorin-Kapov e Varela):

Spazio Contenuto
Applicazione configurazioni dell'applicazione: codifica, risoluzione, frame rate, tipo di contenuto, dimensione del buffer di jitter, correzione d'errore
Risorse fattori di rete e sistema legati alle risorse: banda (bit-rate), perdite, ritardo, capacità di server e client
Contesto situazione d'uso: condizioni ambientali, luogo, ora, condizioni sociali, costo
Utente profilo, preferenze, requisiti, aspettative, esperienza pregressa
QoE metriche qualitative e quantitative (MOS, facilità d'uso, efficienza, soddisfazione, disponibilità, comfort, utilità)

La stima della QoE si ottiene con un mapping dai primi quattro spazi a Q: dando un fattore di peso a ogni dimensione individuale della QoE.

Relazione con la QoS. Una QoE elevata richiede una QoS adeguata (ma non basta): applicazioni diverse hanno requisiti diversi. Per "percepire" l'effetto della QoS sulla QoE si può simulare la trasmissione di un flusso multimediale codificato. Esempio nelle demo del corso: errori su bit nella trasmissione di un'immagine, con parametri QoS (formato di codifica: non compresso BMP, JPEG, JPEG2000, che è più avanzato e più robusto; throughput di 10 Mbit/s; tasso d'errore sul bit; uso di un codice correttore d'errore) e parametri QoE (tempo di download e "qualità dell'immagine"). Tre osservazioni: il file non compresso impiega più tempo ma un bit errato cambia un solo pixel; il file compresso è molto più veloce da scaricare ma un errore su bit può compromettere interi blocchi per la decodifica a lunghezza variabile (Compressione di immagini - DCT e standard JPEGPer comprimere con perdita non basta quantizzare i pixel (non sono sparsi): si applica una trasformata lineare ortogonale che concentra l'energia in pochi coefficienti, si quantizzano i coefficienti e si codificano senza perdita. Le trasformate ortogonali conservano l'MSE ($\frac1N|\mathbf x-\tilde{\mathbf x}|^2=\frac1N|\mathbf y-\tilde{\mathbf y}|^2$). JPEG baseline: si sottrae 128, si divide in blocchi $8\times8$, DCT 2D ($Y=AXA^T$), quantizzazione uniforme con tabella (passi piccoli a bassa frequenza, scalata da un fattore di qualità $Q$), zig-zag scan, DC codificato in modo differenziale con categoria/ampiezza, AC con coppie (run, categoria) e simbolo EOB, codici di Huffman non standardizzati scritti nel file. Esempio completo: un blocco da 512 bit diventa 49 bit (0,766 bit/pixel).Compressione di immagini - DCT e standard JPEG →); un codice correttore riduce gli errori a costo di un po' di tempo in più.

3. Come si misura la qualità

La qualità di un segnale multimediale (nelle note precedenti solo MSE e PSNR) si valuta con due grandi famiglie:

Valutazione della qualità
 |-- Soggettiva: single stimulus, double stimulus
 |-- Oggettiva : full reference, reduced reference, no reference
  • Soggettive: si basano sul giudizio di un gruppo di persone. Sono lente, complesse e costose, ma sono le più rilevanti (la qualità è, per definizione, ciò che percepisce l'utente).
  • Oggettive: definite da una formula matematica o da un algoritmo; si calcolano automaticamente e si integrano nelle tecniche di ottimizzazione (per esempio nel codificatore). Idealmente dovrebbero dare risultati simili a quelli soggettivi. Si distinguono per quanta informazione sul segnale di riferimento (originale) usano: full reference (tutto l'originale), reduced reference (solo alcune caratteristiche), no reference (nessuno: solo il segnale degradato).

4. Metriche soggettive

I test soggettivi sono il modo più affidabile per misurare la QoE di un servizio multimediale, ma sono lunghi e richiedono molti utenti per risultati affidabili. Per avere risultati affidabili e riproducibili bisogna descrivere con cura:

  • le apparecchiature del laboratorio (schermo, distanza di osservazione, illuminazione, riverberazione della stanza);
  • il dataset: contenuti originali ed elaborati e loro distribuzione;
  • la metodologia: obiettivo (qualità, confronto, degradazione), scala (categorica o continua), tipo di stimoli (singoli o doppi);
  • l'elaborazione dei risultati: normalizzazione dei punteggi, rilevamento degli outlier, media e intervalli di confidenza, test di significatività.

4.1 Il MOS

Il punteggio si misura con il MOS (Mean Opinion Score): la media aritmetica dei punteggi individuali dati da un gruppo di utenti alla qualità percepita di un segnale. La scala più usata è la Absolute Category Rating (ACR):

Voto Giudizio
5 Excellent
4 Good
3 Fair
2 Poor
1 Bad

4.2 Il dataset: informazione spaziale e temporale

Gli stimoli (segnali di test) dipendono dall'obiettivo (confrontare algoritmi di compressione, valutare un denoising, ...); è importante coprire una larga varietà di casi. Per i video si confrontano l'informazione spaziale e temporale delle sequenze.

  • Spatial Information (SI): quantità di dettaglio spaziale. Si basa sul filtro di Sobel, analogo discreto del gradiente: il gradiente orizzontale GxG_x è la media pesata dei tre pixel a destra del pixel corrente meno quella dei tre a sinistra (pesi 1,2,11,2,1), il verticale GyG_y usa la maschera trasposta, il gradiente totale è G=Gx2+Gy2G=\sqrt{G_x^2+G_y^2} (grande vicino ai contorni, piccolo nelle aree piatte). Per ogni fotogramma FnF_n si calcola la deviazione standard spaziale dell'immagine filtrata; SI=max⁡tempo σspazio[Sobel(Fn)]\mathrm{SI}=\max_{\text{tempo}}\,\sigma_{\text{spazio}}[\mathrm{Sobel}(F_n)]. Esempio delle slide: SI=161,6\mathrm{SI}=161{,}6.
  • Temporal Information (TI): quantità di cambiamenti temporali. Si definisce la mappa delle differenze temporali Mn(i,j)=Fn(i,j)−Fn−1(i,j)M_n(i,j)=F_n(i,j)-F_{n-1}(i,j) e TI=max⁡tempo{σspazio[Mn(i,j)]}\mathrm{TI}=\max_{\text{tempo}}\{\sigma_{\text{spazio}}[M_n(i,j)]\}. Grande per sequenze con molto movimento. Esempio delle slide: TI=39,20\mathrm{TI}=39{,}20.

(Se si possono usare poche sequenze, conviene sceglierle in modo da coprire un'ampia porzione del piano SI-TI.)

4.3 Protocollo del test

Il test deve seguire un protocollo preciso: screening iniziale (esclusione di partecipanti non adatti, per esempio daltonici se conta il colore); spiegazione del test e firma del consenso; sessione di training (mostra la gamma e il tipo di degradazioni, con contenuti diversi da quelli del test ma comparabili); valutazione degli stimoli del test; questionario finale (opzionale). Una sessione non dovrebbe durare più di mezz'ora; all'inizio si inseriscono quattro o cinque immagini "fittizie" per stabilizzare l'opinione degli osservatori (i loro voti non entrano nei risultati); le immagini e le degradazioni sono presentate in sequenza pseudo-casuale, e preferibilmente diversa in ogni sessione.

4.4 Metodi di valutazione

  • Single Stimulus (SS) / ACR: si presenta una singola immagine o sequenza e il valutatore ne giudica la qualità (scala ACR). Il materiale può includere solo segnali di test o anche il riferimento nascosto (hidden reference, HR), valutato come qualunque altro stimolo; in analisi si calcola il DMOS (differential MOS) tra ogni sequenza di test e il suo riferimento. Pro: si testano più stimoli nello stesso tempo; contro: può essere insensibile ad alcune distorsioni e influenzato dal contenuto.
  • Degradation Category Rating (DCR) (double stimulus): si mostrano riferimento e test e si giudica la degradazione con la scala: 5 imperceptible, 4 perceptible but not annoying, 3 slightly annoying, 2 annoying, 1 very annoying. Richiede più tempo, è più sensibile e meno influenzato dal contenuto.
  • Pair Comparison (PC): si forza l'utente a scegliere tra due stimoli ("quale immagine preferisci?"). Richiede tempo (ci sono strategie per accelerare), più sensibile e meno influenzato dal contenuto.

Ambiente controllato o no. Controllato: schermo, illuminazione, distanza fissi; meno distrazioni; partecipanti meno diversificati e più difficili da trovare. Non controllato (crowdsourcing): condizioni variabili e dati più rumorosi, più distrazioni e nessuna supervisione, ma partecipanti più diversificati e più facili da trovare.

Fonti di rumore. Casuali: partecipanti con cattive intenzioni (guadagno con il crowdsourcing: risposte ripetute, bassa attenzione); partecipanti che non hanno capito il compito (risposte invertite, uso incompleto della scala); contesto (video sui social contro video al cinema). Sistematiche: impatto ambientale (dispositivi diversi in ambiente non controllato); problemi del sistema visivo; partecipanti sbilanciati su una parte della scala (voti sempre alti o sempre bassi, o solo nell'intervallo 3-5).

4.5 Elaborazione dei MOS

I valori misurati si considerano realizzazioni di una variabile aleatoria, assunta gaussiana. Con NN osservatori e voti xix_i:

  • media (stimatore del valor medio, cioè il MOS): m=1N∑i=1Nxim=\frac1N\sum_{i=1}^Nx_i;
  • deviazione standard: s=1N−1∑i=1N(xi−m)2s=\sqrt{\frac1{N-1}\sum_{i=1}^N(x_i-m)^2}. Si usa N−1N-1 e non NN perché anche mm è una stima e non la vera media μ\mu (se si conoscesse μ\mu si dividerebbe per NN);
  • errore standard (stima della deviazione standard dello stimatore della media): SE=sN\mathrm{SE}=\frac s{\sqrt N};
  • intervallo di confidenza al 95%: m±1,96 SEm\pm1{,}96\,\mathrm{SE}.

L'intervallo di confidenza non significa che μ\mu cada nell'intervallo con probabilità 95% (perché μ\mu non è aleatorio!); significa che, ripetendo lo stesso esperimento con lo stesso numero di osservatori, nel 95% dei casi il valor medio vero cade nell'intervallo stimato. È più corretto vederlo come una misura dell'affidabilità del metodo usato per stimare il parametro.

Esempio (10 osservatori, scala ACR). Voti: un 2, due 3, cinque 4, due 5. MOS=m=2+6+20+1010=3,8\mathrm{MOS}=m=\frac{2+6+20+10}{10}=3{,}8. ∑(xi−m)2=3,24+2⋅0,64+5⋅0,04+2⋅1,44=7,6\sum(x_i-m)^2=3{,}24+2\cdot0{,}64+5\cdot0{,}04+2\cdot1{,}44=7{,}6, s=7,6/9=0,919s=\sqrt{7{,}6/9}=0{,}919. SE=0,91910=0,291\mathrm{SE}=\frac{0{,}919}{\sqrt{10}}=0{,}291, intervallo 3,8±0,573{,}8\pm0{,}57. Con 30 osservatori e giudizi dello stesso tipo (due 2, sette 3, quindici 4, sei 5: media 3,83, s=0,834s=0{,}834) l'errore standard scende a 0,1520{,}152 e l'intervallo a ±0,30\pm0{,}30: cresce come 1N\frac1{\sqrt N}, quindi servono tanti osservatori.

5. Metriche oggettive per immagini e video

Scopo: predire il risultato di uno studio soggettivo con un algoritmo (o formula). Vantaggi: praticità e scalabilità. Qui si considerano metodi full-reference. Notazione: I(n,m,c,t)I(n,m,c,t) è l'intensità della componente cc in posizione (n,m)(n,m) al tempo tt del segnale di riferimento, I^(n,m,c,t)\hat I(n,m,c,t) quella del segnale di prova; lo spazio colore è tipicamente YCbCr (talvolta RGB).

5.1 MSE e PSNR

L'errore quadratico medio della sola luminanza (per un frame al tempo tt): MSEY(t)=1NM∑n,m[I(n,m,1,t)−I^(n,m,1,t)]2\mathrm{MSE}_Y(t)=\frac1{NM}\sum_{n,m}\bigl[I(n,m,1,t)-\hat I(n,m,1,t)\bigr]^2, e PSNRY(t)=10log⁡102552MSEY(t)≈48 dB−10log⁡10MSEY(t)\mathrm{PSNR}_Y(t)=10\log_{10}\frac{255^2}{\mathrm{MSE}_Y(t)}\approx48\,\text{dB}-10\log_{10}\mathrm{MSE}_Y(t).

YCbCr-PSNR. Si definiscono allo stesso modo MSECb,PSNRCb,PSNRCr\mathrm{MSE}_{C_b},\mathrm{PSNR}_{C_b},\mathrm{PSNR}_{C_r} (con N2×M2\frac N2\times\frac M2 campioni in 4:2:0) e una misura globale per immagini a colori PSNRYCbCr=34PSNRY+18PSNRCb+18PSNRCr.\mathrm{PSNR}_{\mathrm{YCbCr}}=\tfrac34\mathrm{PSNR}_Y+\tfrac18\mathrm{PSNR}_{C_b}+\tfrac18\mathrm{PSNR}_{C_r}. I pesi più piccoli riflettono il minore impatto dei colori sulla percezione. Esempio: PSNRY=40\mathrm{PSNR}_Y=40, PSNRCb=44\mathrm{PSNR}_{C_b}=44, PSNRCr=45\mathrm{PSNR}_{C_r}=45 dB: 0,75⋅40+0,125⋅44+0,125⋅45=41,1250{,}75\cdot40+0{,}125\cdot44+0{,}125\cdot45=41{,}125 dB.

PSNR di un video: la media dei PSNR dei singoli frame, PSNRY=1T∑t=1TPSNRY(t)\mathrm{PSNR}_Y=\frac1T\sum_{t=1}^T\mathrm{PSNR}_Y(t) (e allo stesso modo le componenti e la media pesata con 34,18,18\frac34,\frac18,\frac18). Esempio nelle slide: sequenza "foreman" con H.264, media del PSNRY≈39,0\mathrm{PSNR}_Y\approx39{,}0 dB.

5.2 Metriche di Bjontegaard

Un codec può comprimere la stessa sequenza a livelli di qualità diversi (per esempio variando il parametro di quantizzazione QP): ogni codifica dà una coppia (tasso RR, PSNR), cioè un punto nel piano tasso-qualità; più punti campionano la curva tasso-distorsione del codificatore. Per confrontare due codec con un solo numero si usano le metriche di Bjontegaard:

  • BD-PSNR (Bjontegaard Delta PSNR): differenza media di PSNR a parità di tasso, in dB;
  • BD-rate: differenza media di tasso a parità di PSNR, in percentuale.

Calcolo del BD-PSNR: si individua un intervallo di tassi [R1,R2][R_1,R_2] in cui sono disponibili punti per entrambi i codec e si confrontano i PSNR medi. Se fA(R)f_A(R) e fB(R)f_B(R) fossero note come funzioni continue: BD-PSNR=1R2−R1∫R1R2(fA(R)−fB(R))dR,\mathrm{BD\text{-}PSNR}=\frac1{R_2-R_1}\int_{R_1}^{R_2}\bigl(f_A(R)-f_B(R)\bigr)dR, l'area tra le due curve divisa per l'ampiezza dell'intervallo. Le funzioni si approssimano con polinomi di terzo grado nella variabile t=log⁡Rt=\log R, il che permette il calcolo in forma chiusa. Il BD-rate si definisce analogamente, scambiando gli assi (area tra le curve in orizzontale: differenza di tasso a parità di qualità). Un BD-rate negativo significa risparmio di bit.

Grafico interattivo: Curve tasso-distorsione di due codec (asse del tasso logaritmico): A sta sopra B. Il BD-PSNR è l'area (colorata) tra le curve nell'intervallo di tassi comune, divisa per l'ampiezza dell'intervallo (qui, curve parallele: 1,8 dB)

5.3 Limiti del PSNR e metriche più vicine alla percezione

Il PSNR dipende dalle differenze pixel per pixel:

  • uno spostamento spaziale dell'immagine riduce molto il PSNR anche se l'immagine percepita è buona;
  • non tiene conto degli effetti di mascheramento né della sensibilità in frequenza dell'occhio;
  • non tiene conto di fenomeni come la banda di Mach (il sistema visivo sotto o sopra stima i confini tra regioni di diversa intensità) o dell'effetto per cui la luminosità percepita di una regione dipende anche dallo sfondo.

SSIM (Structural Similarity Index): per rappresentare meglio la qualità soggettiva. Gli approcci precedenti quantificano la distorsione valutando la percezione dell'errore; l'SSIM la quantifica come cambiamento dell'informazione strutturale dell'immagine, includendo luminance masking e contrast masking. Nella formulazione originale (approfondimento) per due finestre x,yx,y: SSIM(x,y)=(2μxμy+C1)(2σxy+C2)(μx2+μy2+C1)(σx2+σy2+C2)\mathrm{SSIM}(x,y)=\dfrac{(2\mu_x\mu_y+C_1)(2\sigma_{xy}+C_2)}{(\mu_x^2+\mu_y^2+C_1)(\sigma_x^2+\sigma_y^2+C_2)} (μ\mu medie, σ2\sigma^2 varianze, σxy\sigma_{xy} covarianza, C1,C2C_1,C_2 piccole costanti) vale al più 1 e vale 1 solo per finestre identiche. Nelle slide, sulla stessa immagine con MSE=210\mathrm{MSE}=210: contrasto aumentato MSSIM=0,917\mathrm{MSSIM}=0{,}917; media scalata 0,9900{,}990; JPEG 0,6950{,}695; sfocata 0,7050{,}705; rumore sale e pepe 0,7750{,}775. Cioè a MSE uguale (210) le immagini sono percepite in modo molto diverso: l'SSIM le ordina meglio dell'MSE. In un altro test (MSE =16=16 per quattro immagini) l'SSIM varia da 0,882 a 0,987, mentre uno spostamento di un pixel in orizzontale e verticale ha MSE 33 e SSIM 0,936.

VMAF (Video Multimethod Assessment Fusion): metrica di qualità video sviluppata da Netflix con altre aziende e università. Confronta un video di riferimento con la versione distorta o compressa; usa un modello di apprendimento automatico (machine learning) che fonde diverse metriche, addestrato su grandi insiemi di dati di valutazione soggettiva (spettatori che giudicano video con varie distorsioni) per predire come gli spettatori valuterebbero il video. Molto usata nello streaming per confrontare tecniche di elaborazione, ottimizzare le impostazioni di codifica e valutare i codec, usando in modo efficiente banda e archiviazione.

6. Quello che le metriche non vedono

PSNR, SSIM e VMAF valutano la qualità di ogni immagine. Nessuna di queste metriche riflette gli eventi di stallo e le variazioni di qualità di uno streaming: per questo serve una metrica di QoE che tenga conto di qualità per segmento, numero e durata dei rebuffering, variazioni di livello e buffering iniziale (Streaming adattativo e DASHPer non stallare serve $R_C\le S$ (tasso di codifica non superiore al throughput), ma $R_C$ si controlla e $S$ no. Se $S<R_C$ la latenza cresce, i buffer dei router si riempiono e si perdono pacchetti; né il drop brutale né il transcoding in rete sono praticabili, la scalabilità (SVC) è parziale. La soluzione dominante è lo streaming adattativo (ABR) tirato dal client su HTTP: il video è diviso in $N$ segmenti da $T_S$ secondi, ciascuno in $K$ livelli di bit-rate $R_C(k)$ descritti nell'MPD; il client sceglie il livello $q(n)$ di ogni segmento con $T_D=\frac{T_SR_C(q)}{S_n}$. Il playout buffer $B(t)$ (in secondi di video) segue $B'=\frac S{R_C}$ durante lo stallo e $B'=\frac S{R_C}-1$ durante la riproduzione; si parte dopo $L$ segmenti e dopo uno stallo si riprende con $M$ nuovi segmenti. La QoE si modella con $J=\sum_n\lambda_1k_n-\lambda_2\lvert k_n-k_{n-1}\rvert-\phi(\Delta_n)-\lambda_3T_{ST}$. Gli algoritmi ABR sono basati su throughput, buffer o ibridi; MPEG-DASH standardizza MPD e segmenti, non il client.Streaming adattativo e DASH →).

Domande d'esame

1. Qual è la differenza tra QoS e QoE? Traccia: la QoS è un insieme di caratteristiche tecniche del servizio misurabili sulla rete (throughput, ritardo, jitter, perdite, disponibilità, affidabilità; ITU-T E.800), orientata alla tecnologia; la QoE è il grado di gradimento o fastidio dell'utente, dipende anche da applicazione, contesto e utente (ARCU) e richiede una QoS adeguata, che è condizione necessaria ma non sufficiente.

2. Come si misura il MOS e quanto è affidabile? Traccia: media dei voti (scala ACR da 1 a 5) di un gruppo di osservatori in un test controllato; l'affidabilità si valuta con deviazione standard s=1N−1∑(xi−m)2s=\sqrt{\frac1{N-1}\sum(x_i-m)^2}, errore standard sN\frac s{\sqrt N} e intervallo di confidenza ±1,96 SE\pm1{,}96\,\mathrm{SE}, che si stringe come 1N\frac1{\sqrt N}.

3. Perché il PSNR non basta e che cosa propongono SSIM e VMAF? Traccia: il PSNR confronta pixel per pixel, ignora percezione (mascheramento, sensibilità in frequenza) e penalizza spostamenti innocui; l'SSIM misura la variazione dell'informazione strutturale; VMAF combina più metriche con machine learning addestrato su giudizi umani; nessuna cattura stalli e variazioni di qualità.

Versione ripasso

QoS (ITU-T E.800): caratteristiche di un servizio di telecomunicazioni che ne determinano la capacità di soddisfare le esigenze dichiarate e implicite dell'utente. Insieme di tecnologie e misure per risultati prevedibili. Indici: throughput, ritardo, jitter, perdite, disponibilità (server non disponibile) e affidabilità (il servizio cade durante l'uso). Importante per traffico ad alto bit-rate e real-time. Limiti: orientata alla tecnologia, contesto e utente non trattati.

QoE. Qualità percepita dall'utente: "grado di gradimento o fastidio" (Qualinet). Per servizio: dati (risposta rapida, nessun errore), voce (nessuna caduta, buona qualità), video (alta qualità, fluido, niente blocchi, sincronia). Difficile da misurare: utenti diversi, contesto, applicazione. Modello ARCU: Applicazione (codec, risoluzione, fps, buffer di jitter, correzione), Risorse (bit-rate, perdite, ritardo, server e client), Contesto (ambiente, luogo, ora, costo), Utente (profilo, aspettative, esperienza) →\to mapping pesato →\to spazio QoE (MOS, usabilità, soddisfazione...). La QoE richiede una QoS adeguata. Esempio: errori su bit su immagini BMP, JPEG, JPEG2000 (QoS: formato, throughput 10 Mbit/s, tasso d'errore, codice correttore; QoE: tempo di download e qualità).

Tassonomia. Soggettiva (single/double stimulus) e oggettiva (full/reduced/no reference). Soggettive: giudizio di persone, lente e costose ma le più rilevanti. Oggettive: formula o algoritmo, automatizzabili, ottimizzabili.

Soggettive.

  • Da descrivere: apparecchiature, dataset, metodologia (obiettivo, scala, stimoli), elaborazione.
  • MOS = media aritmetica dei punteggi; ACR: 5 excellent, 4 good, 3 fair, 2 poor, 1 bad.
  • SI (informazione spaziale): max⁡tσspazio[Sobel(Fn)]\max_t\sigma_{\text{spazio}}[\mathrm{Sobel}(F_n)], G=Gx2+Gy2G=\sqrt{G_x^2+G_y^2}; TI: max⁡tσspazio[Fn−Fn−1]\max_t\sigma_{\text{spazio}}[F_n-F_{n-1}].
  • Protocollo: screening, spiegazione e consenso, training (contenuti diversi dal test), valutazione, questionario; sessioni sotto 30 minuti; 4-5 immagini fittizie iniziali escluse; ordine pseudo-casuale.
  • SS/ACR (stimolo singolo, riferimento nascosto, DMOS: più stimoli, ma meno sensibile e dipendente dal contenuto); DCR (doppio stimolo: 5 imperceptible, 4 perceptible but not annoying, 3 slightly annoying, 2 annoying, 1 very annoying; più lento, più sensibile); PC (scelta tra due immagini: lento, sensibile).
  • Controllato (dati puliti, pochi partecipanti) contro non controllato (rumoroso, partecipanti più diversi). Rumore casuale (cattive intenzioni, compito frainteso) e sistematico (dispositivi, bias di scala).
  • Statistica (NN voti): m=1N∑xim=\frac1N\sum x_i; s=1N−1∑(xi−m)2s=\sqrt{\frac1{N-1}\sum(x_i-m)^2} (N−1N-1 perché mm è una stima); SE=sN\mathrm{SE}=\frac s{\sqrt N}; intervallo m±1,96 SEm\pm1{,}96\,\mathrm{SE} (95%: nel 95% delle ripetizioni dell'esperimento l'intervallo contiene la media vera; misura l'affidabilità del metodo). Esempio 10 voti (2,3,3,4,4,4,4,4,5,5): m=3,8m=3{,}8, s=0,919s=0{,}919, SE=0,291\mathrm{SE}=0{,}291, ±0,57\pm0{,}57.

Oggettive full-reference.

  • PSNRY(t)=10log⁡102552MSEY(t)≈48−10log⁡10MSEY\mathrm{PSNR}_Y(t)=10\log_{10}\frac{255^2}{\mathrm{MSE}_Y(t)}\approx48-10\log_{10}\mathrm{MSE}_Y. YCbCr-PSNR =34PSNRY+18PSNRCb+18PSNRCr=\frac34\mathrm{PSNR}_Y+\frac18\mathrm{PSNR}_{C_b}+\frac18\mathrm{PSNR}_{C_r} (esempio 40, 44, 45 dB: 41,125 dB). Video: media dei PSNR dei frame.
  • Bjontegaard: curve tasso-distorsione (punti (R, PSNR) al variare di QP). BD-PSNR = differenza media di PSNR a parità di tasso (dB), 1R2−R1∫(fA−fB)dR\frac1{R_2-R_1}\int(f_A-f_B)dR con polinomi di grado 3 in log⁡R\log R; BD-rate = differenza media di tasso a parità di PSNR (%), negativa = risparmio.
  • Limiti del PSNR: uno spostamento riduce molto il PSNR senza peggiorare la percezione; ignora mascheramento, sensibilità in frequenza, banda di Mach.
  • SSIM: variazione dell'informazione strutturale, include luminance e contrast masking; SSIM=(2μxμy+C1)(2σxy+C2)(μx2+μy2+C1)(σx2+σy2+C2)\mathrm{SSIM}=\frac{(2\mu_x\mu_y+C_1)(2\sigma_{xy}+C_2)}{(\mu_x^2+\mu_y^2+C_1)(\sigma_x^2+\sigma_y^2+C_2)}; a MSE uguale ordina meglio dell'MSE. VMAF (Netflix): machine learning addestrato su giudizi soggettivi, fonde metriche; usata nello streaming.
  • Nessuna riflette stalli e variazioni di qualità.

Errori tipici: dire che QoS e QoE sono sinonimi; usare NN al posto di N−1N-1 nella deviazione standard; dire che il 95% è la probabilità che μ\mu stia nell'intervallo; credere che a PSNR uguale la qualità sia uguale; confondere full, reduced e no reference; dimenticare che il BD-rate è in percentuale e il BD-PSNR in dB.

Collegamenti: Metriche e prestazioni di rete per i servizi multimedialiUna rete è una pila di livelli: ogni livello offre un servizio al superiore tramite un'interfaccia e dialoga con il livello pari con un protocollo; il pacchetto di un livello è il payload del livello inferiore ($\mathrm{PDU}n=\mathrm{PCI}n+\mathrm{SDU}n$), con efficienza $\eta=\frac{|\mathrm{SDU}n|}{|\mathrm{PDU}n|}$. Metriche: bit-rate $R_0$ (livello fisico) $\ge$ throughput $S$ $\ge$ goodput (throughput a lungo termine a livello applicazione). Ritardo nodale $d=d{proc}+d{queue}+d{trans}+d{prop}$ con $d{trans}=\frac LR$ e $d_{prop}=\frac xc$; ritardo end-to-end = somma dei nodali; jitter = variabilità del ritardo; BDP $=S\cdot\mathrm{RTT}$ (con il bit-rate minimo del percorso). Affidabilità: nel canale binario simmetrico $\mathrm{PER}=1-(1-\varepsilon)^L$ e $P(\ell)=\binom L\ell\varepsilon^\ell(1-\varepsilon)^{L-\ell}$; codici di canale $R=\frac kn$, parità, Hamming, interleaving per i burst; perdite per errori o congestione, $\mathrm{PDR}=1-P_{\text{LOSS}}$.Metriche e prestazioni di rete per i servizi multimediali →, Streaming adattativo e DASHPer non stallare serve $R_C\le S$ (tasso di codifica non superiore al throughput), ma $R_C$ si controlla e $S$ no. Se $S<R_C$ la latenza cresce, i buffer dei router si riempiono e si perdono pacchetti; né il drop brutale né il transcoding in rete sono praticabili, la scalabilità (SVC) è parziale. La soluzione dominante è lo streaming adattativo (ABR) tirato dal client su HTTP: il video è diviso in $N$ segmenti da $T_S$ secondi, ciascuno in $K$ livelli di bit-rate $R_C(k)$ descritti nell'MPD; il client sceglie il livello $q(n)$ di ogni segmento con $T_D=\frac{T_SR_C(q)}{S_n}$. Il playout buffer $B(t)$ (in secondi di video) segue $B'=\frac S{R_C}$ durante lo stallo e $B'=\frac S{R_C}-1$ durante la riproduzione; si parte dopo $L$ segmenti e dopo uno stallo si riprende con $M$ nuovi segmenti. La QoE si modella con $J=\sum_n\lambda_1k_n-\lambda_2\lvert k_n-k_{n-1}\rvert-\phi(\Delta_n)-\lambda_3T_{ST}$. Gli algoritmi ABR sono basati su throughput, buffer o ibridi; MPEG-DASH standardizza MPD e segmenti, non il client.Streaming adattativo e DASH →, Digitalizzazione dei segnali multimediali - campionamento, quantizzazione e binarizzazioneLa conversione analogico-digitale (ADC) ha tre passi: campionamento $s_c(n)=s(nT_c)$, quantizzazione su $L=2^m$ livelli, binarizzazione dell'indice in $m$ bit; il bit-rate vale $R=F_c\log_2L$. Per il teorema di Shannon un segnale a banda limitata $f_M$ si ricostruisce senza errore se $F_c\ge2f_M$ (criterio di Nyquist), altrimenti c'è aliasing; per questo prima del campionatore c'è un filtro passa-basso. La quantizzazione uniforme di passo $\Delta=\frac{2A}{L}$ è irreversibile, con errore massimo $\frac\Delta2$ e $\mathrm{MSE}=\frac{\Delta^2}{12}$; la qualità si misura con MSE e $\mathrm{PSNR}=10\log_{10}\frac{(2^b-1)^2}{\mathrm{MSE}}$. In ricezione il bit mapper ricostruisce i valori e l'interpolazione con un nucleo $h$ (sample and hold, lineare, cubica, sinc troncato) riporta il segnale al tempo continuo.Digitalizzazione dei segnali multimediali - campionamento, quantizzazione e binarizzazione →.

Domande tipiche.

  • QoS contro QoE: parametri tecnici di rete contro gradimento dell'utente (ARCU); la QoS adeguata è necessaria ma non sufficiente.
  • Affidabilità del MOS: ss, SE=sN\mathrm{SE}=\frac s{\sqrt N}, intervallo ±1,96 SE\pm1{,}96\,\mathrm{SE} (si stringe come 1N\frac1{\sqrt N}).
  • Limiti del PSNR e metriche alternative: SSIM (struttura), VMAF (machine learning); nessuna cattura stalli e variazioni di qualità.

Esercizi su questo argomento

Teoria collegata