Audio, immagini e video digitali non compressi e spazi di colore
In questa pagina 6
Questa nota applica la catena di digitalizzazioneLa conversione analogico-digitale (ADC) ha tre passi: campionamento $s_c(n)=s(nT_c)$, quantizzazione su $L=2^m$ livelli, binarizzazione dell'indice in $m$ bit; il bit-rate vale $R=F_c\log_2L$. Per il teorema di Shannon un segnale a banda limitata $f_M$ si ricostruisce senza errore se $F_c\ge2f_M$ (criterio di Nyquist), altrimenti c'è aliasing; per questo prima del campionatore c'è un filtro passa-basso. La quantizzazione uniforme di passo $\Delta=\frac{2A}{L}$ è irreversibile, con errore massimo $\frac\Delta2$ e $\mathrm{MSE}=\frac{\Delta^2}{12}$; la qualità si misura con MSE e $\mathrm{PSNR}=10\log_{10}\frac{(2^b-1)^2}{\mathrm{MSE}}$. In ricezione il bit mapper ricostruisce i valori e l'interpolazione con un nucleo $h$ (sample and hold, lineare, cubica, sinc troncato) riporta il segnale al tempo continuo.Digitalizzazione dei segnali multimediali - campionamento, quantizzazione e binarizzazione → ai tre tipi di segnale multimediale: suono, immagine, video. Per ciascuno si vede come sono scelti i parametri (frequenza di campionamento, bit per campione, numero di canali) e quanti bit al secondo o quanti byte risultano. Sono i conti più frequenti nei quiz d'esame (esercizi svolti in Esercizio - Bitrate e dimensione dei segnali non compressi (domande ed esercizi del corso)), e mostrano perché la compressione è indispensabile.
La regola di fondo, per ogni segnale non compresso:
1. Come percepiamo il suono
Il nostro sistema uditivo fa un'analisi in frequenza dei suoni che arrivano all'orecchio: si può modellare come un banco di filtri , ciascuno dei quali analizza una banda di frequenze. Un tono puro a frequenza eccita soprattutto la fibra nervosa che corrisponde a quella banda. Due fenomeni sono importanti per la compressione.
- Soglia di udibilità. Esiste una potenza minima sotto la quale un tono puro di frequenza non si sente; la soglia varia da persona a persona e con l'età. Presa come riferimento la soglia del tono a 1 kHz, la soglia in funzione della frequenza è molto alta agli estremi dello spettro udibile e più bassa nella zona 1-5 kHz (a forma di conca). I suoni sotto la curva sono inutili da codificare.
- Mascheramento in frequenza. Se un tono forte è presente, alza la soglia per le frequenze vicine: un tono debole accanto a uno forte non si sente. La funzione di innalzamento della soglia decresce con la distanza in frequenza, ma non è simmetrica: scende più lentamente per le frequenze superiori. Un tono maschera più le frequenze più alte che quelle più basse.
- Mascheramento temporale. Il tono forte maschera anche nel tempo: un po' prima (pre-masking, 2-5 ms) e molto dopo (post-masking, 100-200 ms).
Codifica percettiva. Si può quantizzare (comprimere) il segnale acustico in modo che il rumore di quantizzazione generato cada sotto la soglia di mascheramento e quindi non si senta. Si realizza dando forma allo spettro del rumore, oppure con un'analisi tempo-frequenza che quantizza grossolanamente le componenti mascherate. È il principio di MP3 e AAC.
2. Parlato: PCM a 64 kbit/s
La potenza del segnale vocale è concentrata nella banda Hz. Il parlato si acquisisce quindi con un filtro passa-basso a kHz e campionamento a kHz (Nyquist: ). Il numero di livelli di quantizzazione è stato trovato sperimentalmente. Due scelte comuni:
- 128 livelli, cioè 7 bit per campione (in uso in Asia e America): kbit/s;
- 256 livelli, cioè 8 bit (nel resto del mondo): kbit/s.
Nel seguito si prende : . Questo schema è chiamato PCM (pulse code modulation), anche se a rigore non è una modulazione ma uno schema di digitalizzazione (una modulazione associa a ogni stringa di bit una forma d'onda da trasmettere sul canale per un intervallo di simbolo; per esempio una QPSK associa a quattro fasi della portante).
Pacchettizzazione. Un pacchetto corrisponde tipicamente a 20 ms di voce: campioni, cioè byte con 8 bit ( byte con 7 bit, perché ). Il ritmo è quindi 50 pacchetti al secondo. Per ridurre i 64 kbit/s si usano i codificatori vocali (Codifica della voceIl parlato è localmente stazionario su circa 20 ms e comprende suoni vocali (pseudo-periodici, con pitch) e non vocali (simili a rumore). Si codifica in tre modi: a forma d'onda (PCM, G.711: 64 kbit/s, qualità alta), con vocoder (modellano la produzione della voce, 2,4 kbit/s o meno, voce innaturale) e ibridi (parametri del modello più codifica del residuo: G.729 a 8 kbit/s, GSM a 13, AMR-WB 6,6-23,85, Opus 6-510 kbit/s). Nel vocoder LPC10 ogni 20 ms (160 campioni) si trasmettono 10 coefficienti del filtro di predizione (36 bit), un bit voiced/unvoiced, potenza (6 bit) e, se vocale, il pitch (7 bit): 2500 o 2150 bit/s. Contano anche latenza, resilienza agli errori (FEC) e soppressione del silenzio (VAD).Codifica della voce →).
3. Musica: il CD audio
Per la musica, intesa come qualsiasi segnale audio non garantito sotto i 4 kHz, i parametri che rendono impercettibile la distorsione sono:
- banda utile Hz;
- due canali (stereo): la stereofonia dà al cervello la direzione di provenienza del suono;
- kHz con filtro anti-aliasing (leggermente più di kHz);
- 16 bit per campione, cioè livelli (scelta empirica: trasparenza, nessuna distorsione percepibile).
Un solo canale (mono) richiede kbit/s.
Esempio (capacità di un CD). Il flusso scritto sul disco contiene dati utili al e il è codice di protezione dagli errori (CRC e correzione). Il disco ha MB di dati utili.
- Bit-rate totale (dati più protezione): Mbit/s. Perché si divide per : i dati utili sono l' del totale, quindi totale = utili / 0,87.
- Durata massima: bit utili disponibili diviso data rate: s minuti. Si usa il data rate dei soli dati utili, perché i 730 MB sono utili.
| Segnale | livelli | bit/campione | canali | data rate | |
|---|---|---|---|---|---|
| Parlato | 8 kHz | 256 | 8 | 1 | 64 kbit/s |
| Musica | 44,1 kHz | 65 536 | 16 | 2 | 1,411 Mbit/s |
La frequenza di campionamento è scelta leggermente sopra (Nyquist); il numero di livelli è scelto empiricamente per assicurare intelligibilità al parlato e trasparenza alla musica; il numero di canali asseconda l'esigenza di spazializzazione.
Passaggi da ricordare per i quiz audio.
- Dimensione di un file: . Esempio: 128 kbit/s per 10 minuti: kbit MB.
- Quanta musica sta su un supporto: ; se c'è un codice di canale di rapporto , il bit-rate che occupa il supporto è (più grande, perché si aggiungono bit).
- Banda con quantizzazione su livelli: bit per campione (2048 livelli 11 bit).
4. Immagini
4.1 Acquisizione e quantizzazione
La luce della scena attraversa le ottiche e colpisce il sensore sul piano d'immagine. Ogni pixel del sensore misura la luce che colpisce la sua superficie: si compie un filtraggio e un campionamento spaziale bidimensionale. La qualità aumenta con il numero di pixel (le prime fotocamere digitali: circa 1 Mpixel; oggi oltre 100 Mpixel).
Le immagini in scala di grigi si rappresentano con 1 byte per pixel: 256 livelli di grigio, praticamente indistinguibili da una versione non quantizzata. Ma 256 livelli di luminosità possono non bastare se nell'immagine ci sono zone molto più scure (sottoesposte) o molto più chiare (sovraesposte) del resto: i valori "veri" di quelle zone finiscono a 0 o a 255 e si perde il dettaglio. Soluzione: più bit per pixel. I formati HDR (high dynamic range, gamma dinamica estesa) usano 10 o 12 bit per campione. (Non vanno confusi con le tecniche che simulano l'HDR fondendo più foto scattate a esposizioni diverse.)
4.2 Immagini a colori: lo spazio RGB
L'occhio percepisce i colori grazie ai coni della retina: ce ne sono di tre tipi, ciascuno con una diversa risposta in funzione della lunghezza d'onda. La sensazione di colore è prodotta dal cervello a partire dal tristimolo, la tripletta delle intensità di risposta dei tre coni. Un colore si può quindi ottenere combinando tre colori primari: rosso, verde, blu. Lo spazio RGB rappresenta il colore di un pixel con tre intensità; la tripletta modula la luce dei led di uno schermo.
Ogni canale è su bit; con si hanno colori (24 bit/pixel). Con HDR a 10 o 12 bit si arriva a 36 bit/pixel, circa 64 miliardi di colori (l'occhio ne distingue circa 10 milioni, ma la sovrapposizione con l'RGB a 8 bit non è totale: ecco perché l'HDR può servire).
Dimensioni non compresse. Un'immagine RGB a 8 bit/canale pesa byte.
- HD: Mbit MB.
- 100 Mpixel in HDR a 12 bit: Mbit MB.
- pixel RGB: Mbit.
4.3 Cambi di spazio di colore e sparsità
Nello spazio RGB il colore di un pixel è un vettore . Applicando un cambio di coordinate (una rotazione degli assi, cioè la moltiplicazione per una matrice) si ottengono altri spazi, più utili per le applicazioni. Perché interessa una rotazione? Perché i tre canali RGB sono fortemente correlati: le tre immagini R, G, B sono quasi uguali. Il segnale in RGB non è sparso: tutti i campioni hanno più o meno la stessa importanza; se si degrada un canale, si vede su tutta l'immagine.
Segnale sparso. Un segnale è sparso quando contiene pochi campioni "importanti" e molti "non importanti" (trascurabili, o percettivamente poco rilevanti). Un segnale sparso si comprime bene: si quantizza finemente i campioni importanti e grossolanamente gli altri, senza degradare la qualità percepita. Un campione è importante perché ha valore grande, oppure perché è intrinsecamente più rilevante per la percezione.
4.4 Lo spazio YCbCr
Lo spazio YCbCr si ottiene con una rotazione degli assi che porta la diagonale del cubo dei colori (la retta dei grigi, ) a essere uno degli assi, seguita da un offset che mantiene i valori nell'intervallo :
- , la luminanza, è la luminosità del pixel indipendentemente dal colore;
- e , le crominanze, danno l'informazione sul colore (differenze di blu e di rosso rispetto alla luminanza).
Nella pratica la matrice è leggermente diversa dalla rotazione pura, perché si vuole che con anche le nuove componenti stiano in un byte. Per esempio, in una delle versioni in uso (quella dei file JPEG): Un grigio () ha : nessuna informazione di colore. L'inversione è immediata ( e sottrazione dell'offset), ad esempio .
Esempio. Il pixel dà ; ; . Ritrasformando si ritrova .
Perché conviene YCbCr. Il nostro occhio è molto meno sensibile alla crominanza che alla luminanza. Si può quindi scartare tre campioni di crominanza su quattro senza degradazioni visibili: il segnale è sparso dal punto di vista percettivo (campioni importanti: ; meno importanti: e ). Idea per la compressione:
- trasformare da RGB a YCbCr;
- scartare una parte dei campioni di crominanza (decimazione);
- in ricostruzione, ricreare i campioni mancanti con l'interpolazione (basta l'ordine zero: si replica il valore), poi applicare la trasformazione inversa YCbCr RGB.
Anche se i colori ricostruiti non sono identici, l'occhio non se ne accorge. (I sensori acquisiscono nativamente in RGB: YCbCr è un formato di codifica, non di acquisizione.)
4.5 Sottocampionamento del colore: 4:4:4, 4:2:2, 4:2:0
- 4:4:4: tutte e tre le componenti a piena risoluzione (nessun sottocampionamento).
- 4:2:2: e dimezzate in orizzontale.
- 4:2:0 (il più usato): e dimezzate sia in orizzontale sia in verticale (si tiene un campione di crominanza ogni pixel: si scartano dei campioni di crominanza). Si dice anche YUV 4:2:0: "YUV" è un sinonimo pratico di YCbCr, "4:2:0" indica il sottocampionamento spaziale.
Conto delle dimensioni in 4:2:0. Per un frame : ha campioni; e hanno ciascuno. Totale Rispetto all'RGB () si dimezza la dimensione. Esempio: immagine da 10 Mpixel: MB; MB. Compressione ottenuta senza perdita di qualità visiva.
Pipeline: immagine RGB -> RGB-YCbCr -> decimazione di Cb e Cr -> formato 4:2:0 -> file / trasmissione
file -> interpolazione di ordine zero di Cb e Cr -> YCbCr-RGB -> visualizzazioneUn esempio numerico di decimazione e interpolazione di ordine zero su un blocco di (si tengono le righe e colonne dispari: blocco ; si replica ogni valore in un blocco ) è svolto in Esercizio - Sottocampionamento del colore YUV 420 su un blocco (demo del corso): l'errore è piccolo dove l'immagine varia piano e più grande sui bordi.
5. Video
Un video è un flusso di immagini, i fotogrammi (frame). Frequenze tipiche: 24, 30, 50, 60 fps (frame per second). Il minimo di 24 fps dà l'impressione di moto fluido grazie alla persistenza retinica.
Per un video non compresso in 4:2:0 a bit per campione:
| Formato | Risoluzione | Pixel | fps | Tasso (8 bit, 4:2:0) |
|---|---|---|---|---|
| CIF | 101 376 | 30 | 36 Mbit/s | |
| SDTV 576p | 414 720 | 60 | 299 Mbit/s | |
| HDTV 720p | 921 600 | 50 | 553 Mbit/s | |
| HDTV 1080p | 2 073 600 | 50 | 1244 Mbit/s | |
| 2K | 2 211 840 | 50 | 1327 Mbit/s | |
| 4K | 8 847 360 | 50 | 5308 Mbit/s | |
| 8K | 33 177 600 | 50 | 19 907 Mbit/s |
Controllo di una riga: 1080p a 50 fps: bit/s Mbit/s. Con profondità maggiori il tasso sale: 4K a 10 bit in 4:2:0 e 50 fps vale Mbit/s; 8K a 10 bit in 4:4:4 ( campioni per pixel) Mbit/s.
Immagini e video sono quindi dati che richiedono moltissime risorse: i valori di risoluzione e dinamica devono garantire altissima qualità percepita, ma i tassi corrispondenti sono troppo alti per la rete e per la memoria. C'è bisogno della compressione (Codifica lossless - entropia, Huffman e codifiche a dizionarioLa codifica lossless rappresenta i simboli di una sorgente con parole di codice a lunghezza variabile in modo invertibile; si usano codici a prefisso (istantanei). L'entropia $H(X)=\sum p_i\log_2\frac1{p_i}$ è il limite: $H(X)\le\mathcal L^<H(X)+1$ (Shannon), con uguaglianza se le probabilità sono potenze di 1/2. Il codice di Huffman è ottimo ma lascia fino a 1 bit di overhead per simbolo; raggruppando $K$ simboli (codifica a blocchi) si tende al tasso entropico $\mathcal H(X)\le H(X)$, ma la complessità cresce come $M^K$; la codifica aritmetica ($\mathcal L<H+2$ per messaggio) ha complessità lineare. Altre tecniche: dizionario (LZ, DEFLATE di ZIP e PNG, ANS in Zstandard), Exp-Golomb e categoria/ampiezza (usati in JPEG e nei codec video) per interi con probabilità decrescente col modulo, codifica predittiva (si codifica l'errore di predizione, che ha entropia molto più bassa).Codifica lossless - entropia, Huffman e codifiche a dizionario →, Compressione di immagini - DCT e standard JPEGPer comprimere con perdita non basta quantizzare i pixel (non sono sparsi): si applica una trasformata lineare ortogonale che concentra l'energia in pochi coefficienti, si quantizzano i coefficienti e si codificano senza perdita. Le trasformate ortogonali conservano l'MSE ($\frac1N|\mathbf x-\tilde{\mathbf x}|^2=\frac1N|\mathbf y-\tilde{\mathbf y}|^2$). JPEG baseline: si sottrae 128, si divide in blocchi $8\times8$, DCT 2D ($Y=AXA^T$), quantizzazione uniforme con tabella (passi piccoli a bassa frequenza, scalata da un fattore di qualità $Q$), zig-zag scan, DC codificato in modo differenziale con categoria/ampiezza, AC con coppie (run, categoria) e simbolo EOB, codici di Huffman non standardizzati scritti nel file. Esempio completo: un blocco da 512 bit diventa 49 bit (0,766 bit/pixel).Compressione di immagini - DCT e standard JPEG →, Codifica video - stima del moto, MPEG e H.264Un video non compresso costa da centinaia di Mbit/s a decine di Gbit/s; la compressione toglie prima di tutto la ridondanza temporale (immagini consecutive molto simili) con la stima del movimento per block-matching, $\mathbf v^=\arg\min_{\mathbf v},d(B_k^{(\mathbf p)},B_h^{(\mathbf p+\mathbf v)})+\lambda R(\mathbf v)$, e la compensazione del movimento; l'errore di predizione (sparso) si codifica come in JPEG. I fotogrammi sono di tipo I (intra), P (predetti da un riferimento) e B (da due riferimenti, passato e futuro), organizzati in GOP di $N$ immagini con ancore ogni $M$; le I sono 3-5 volte più grandi delle P e 10-20 volte delle B. Il codificatore ibrido contiene un Decoded Frame Buffer per ripetere la predizione del decodificatore. Standard: MPEG-2, H.264/AVC (2003), H.265/HEVC (2013), H.266/VVC (2021), VP9 e AV1: ciascuno dimezza circa il tasso del precedente. Il tasso medio di un GOP I+$N$P è $R_C=fB_I\frac{1+\alpha N}{1+N}$.Codifica video - stima del moto, MPEG e H.264 →). Esempio di rapporto di compressione richiesto: un video 4K (3840x2160, 30 fps, 4:2:0, 8 bit) vale Gbit/s; per trasmetterlo su un collegamento da 10 Mbit/s serve un rapporto di compressione di almeno .
Domande d'esame
1. Qual è lo scopo della trasformazione da RGB a YCbCr? Traccia: ottenere una rappresentazione sparsa percettivamente: l'occhio è meno sensibile a e che a , quindi si possono decimare le crominanze (4:2:0, 3/4 dei campioni scartati, dimensione dimezzata) con impatto piccolo sulla qualità percepita; in ricezione si interpola e si torna a RGB.
2. Un'immagine in YCbCr 4:2:0, 8 bit per canale, è trasmessa senza compressione a 1 Mbit/s. Quanto dura la trasmissione? E in RGB? Traccia: : Mbit; e un quarto ciascuno: totale 72 Mbit 72 s; in RGB il doppio (144 Mbit) 144 s.
3. Un segnale musicale stereo a 44,1 kHz e 16 bit viene registrato su un disco da 730 MB con il 13% di dati di protezione dagli errori. Quanti minuti entrano? Traccia: Mbit/s; i 730 MB sono utili: s min.
Versione ripasso
Regola generale. bit-rate campioni/s bit per campione canali (o componenti). File: ; durata su un supporto: capacità / data rate; con un codice di canale di rapporto il flusso diventa .
Udito. Banco di filtri (analisi in frequenza). Soglia di udibilità (a conca, riferita al tono a 1 kHz). Mascheramento in frequenza: un tono forte alza la soglia vicino a sé, non simmetrico (maschera di più le frequenze superiori). Mascheramento temporale: pre-masking 2-5 ms, post-masking 100-200 ms. Codifica percettiva: il rumore di quantizzazione deve cadere sotto la soglia di mascheramento (MP3, AAC).
Parlato (PCM). Banda 200-3400 Hz, passa-basso a 4 kHz, kHz. 8 bit (256 livelli): kbit/s; 7 bit (128 livelli, Asia e America): 56 kbit/s. Pacchetto da 20 ms campioni B (140 B con 7 bit). PCM è uno schema di digitalizzazione, non una modulazione.
Musica (CD). Banda fino a 20 kHz, kHz, 16 bit, 2 canali: Mbit/s (mono 705,6 kbit/s). Disco da 730 MB utili con 87% di dati e 13% di protezione: Mbit/s; s min (si usa il data rate dei dati utili). poco sopra ; livelli scelti empiricamente; stereo per la direzione del suono.
Immagini. Sensore = campionamento spaziale (pixel). Grigi: 8 bit (256 livelli); HDR 10-12 bit contro sotto e sovraesposizione. RGB: coni di tre tipi, tristimolo; 8 bit per canale bit/pixel ( colori); HDR fino a 36 bit/pixel. Dimensioni: HD Mbit MB; 100 Mpixel a 36 bit MB; RGB Mbit.
YCbCr. Rotazione degli assi (diagonale dei grigi asse ) più offset: luminanza, crominanze. In pratica (JPEG): , , ; un grigio ha . Esempio: .
- Segnale sparso: pochi campioni importanti, molti trascurabili; si quantizza fine gli importanti e grossolano gli altri. RGB non è sparso (canali correlati), YCbCr sì (percettivamente).
- Idea: RGB YCbCr, decimare , in ricezione interpolare (ordine zero) e tornare a RGB.
- 4:4:4 pieno; 4:2:2 crominanze dimezzate in orizzontale; 4:2:0 dimezzate in orizzontale e verticale (scarta 3/4 della crominanza). Campioni: , metà dell'RGB (). 10 Mpixel: RGB 30 MB, 4:2:0 15 MB. In pipeline: RGB YCbCr decimazione file; lettura interpolazione RGB.
Video. 24, 30, 50, 60 fps (24 fps per la persistenza retinica). : CIF 36 Mbit/s; SD 576p60 299; 720p50 553; 1080p50 1244; 2K 1327; 4K 5308; 8K 19 907 Mbit/s; 4K 10 bit 4:2:0 6635; 8K 10 bit 4:4:4 49 766 Mbit/s. Video 4K 30 fps 8 bit 4:2:0: Gbit/s; su 10 Mbit/s servono compressioni di circa 300.
Errori tipici: contare campioni in 4:2:0 (sono ); dimenticare che la divisione per dà il flusso totale e non quello utile; usare i 730 MB come totali (sono utili); confondere 7 bit e 8 bit per campione; scrivere senza arrotondare per eccesso quando non è potenza di 2.
Collegamenti: Digitalizzazione dei segnali multimediali - campionamento, quantizzazione e binarizzazioneLa conversione analogico-digitale (ADC) ha tre passi: campionamento $s_c(n)=s(nT_c)$, quantizzazione su $L=2^m$ livelli, binarizzazione dell'indice in $m$ bit; il bit-rate vale $R=F_c\log_2L$. Per il teorema di Shannon un segnale a banda limitata $f_M$ si ricostruisce senza errore se $F_c\ge2f_M$ (criterio di Nyquist), altrimenti c'è aliasing; per questo prima del campionatore c'è un filtro passa-basso. La quantizzazione uniforme di passo $\Delta=\frac{2A}{L}$ è irreversibile, con errore massimo $\frac\Delta2$ e $\mathrm{MSE}=\frac{\Delta^2}{12}$; la qualità si misura con MSE e $\mathrm{PSNR}=10\log_{10}\frac{(2^b-1)^2}{\mathrm{MSE}}$. In ricezione il bit mapper ricostruisce i valori e l'interpolazione con un nucleo $h$ (sample and hold, lineare, cubica, sinc troncato) riporta il segnale al tempo continuo.Digitalizzazione dei segnali multimediali - campionamento, quantizzazione e binarizzazione →, Compressione di immagini - DCT e standard JPEGPer comprimere con perdita non basta quantizzare i pixel (non sono sparsi): si applica una trasformata lineare ortogonale che concentra l'energia in pochi coefficienti, si quantizzano i coefficienti e si codificano senza perdita. Le trasformate ortogonali conservano l'MSE ($\frac1N|\mathbf x-\tilde{\mathbf x}|^2=\frac1N|\mathbf y-\tilde{\mathbf y}|^2$). JPEG baseline: si sottrae 128, si divide in blocchi $8\times8$, DCT 2D ($Y=AXA^T$), quantizzazione uniforme con tabella (passi piccoli a bassa frequenza, scalata da un fattore di qualità $Q$), zig-zag scan, DC codificato in modo differenziale con categoria/ampiezza, AC con coppie (run, categoria) e simbolo EOB, codici di Huffman non standardizzati scritti nel file. Esempio completo: un blocco da 512 bit diventa 49 bit (0,766 bit/pixel).Compressione di immagini - DCT e standard JPEG →, Esercizio - Bitrate e dimensione dei segnali non compressi (domande ed esercizi del corso).
Domande tipiche.
- Scopo di RGB YCbCr: rappresentazione sparsa percettivamente, decimazione di e (4:2:0) con poco impatto sulla qualità.
- in 4:2:0 a 8 bit su 1 Mbit/s: Mbit, 72 s; in RGB 144 s.
- Musica stereo 44,1 kHz 16 bit su 730 MB con 13% di protezione: Mbit/s, minuti.
Esercizi su questo argomento
- Esercizio - Bitrate e dimensione dei segnali non compressi (domande ed esercizi del corso)
- Esercizio - Domande a risposta aperta (domande ed esercizi del corso)
- Esercizio - Domande di teoria su digitalizzazione, colore e codifica (domande ed esercizi del corso)
- Esercizio - Sottocampionamento del colore YUV 420 su un blocco (demo del corso)