Showing posts with label GOP. Show all posts
Showing posts with label GOP. Show all posts

Friday, November 20, 2015

Pemanfaatan ffprobe

Untuk dapat melihat jenis Frame apakah I, P, atau B maka dapat digunakan ffprobe.

File: tswift.mp4 menggunakan fps 24 (apabila di check dengan ffmpeg -i).

Berikut adalah command untuk memeriksa frame-by-frame dari file tsb.

ffprobe -select_streams v -show_frames tswift.mp4 > detail-tswift.txt

Hasilnya sbb:

[FRAME] 
media_type=video
stream_index=0
key_frame=1
pkt_pts=0
pkt_pts_time=0.000000
pkt_dts=0
pkt_dts_time=0.000000
best_effort_timestamp=0
best_effort_timestamp_time=0.000000
pkt_duration=2
pkt_duration_time=0.041667
pkt_pos=77991
pkt_size=139064
width=1280
height=720
pix_fmt=yuv420p
sample_aspect_ratio=N/A
pict_type=I
coded_picture_number=0
display_picture_number=0
interlaced_frame=0
top_field_first=0
repeat_pict=0
[/FRAME]

[FRAME]
media_type=video
stream_index=0
key_frame=0
pkt_pts=2
pkt_pts_time=0.041667
pkt_dts=2
pkt_dts_time=0.041667
best_effort_timestamp=2
best_effort_timestamp_time=0.041667
pkt_duration=2
pkt_duration_time=0.041667
pkt_pos=217055
pkt_size=9241
width=1280
height=720
pix_fmt=yuv420p
sample_aspect_ratio=N/A
pict_type=P
coded_picture_number=1
display_picture_number=0
interlaced_frame=0
top_field_first=0
repeat_pict=0
[/FRAME]

Terlihat frame ke 1 (coded_picture_number=0), merupakan keyframe (pict_type=I atau key_frame=1),

Sedangkan frame ke 2 (coded_picture_number=1), merupakan P frame.

I Frame (key frame) berikutnya adalah di frame ke 61 (coded_picture_number=60)

[FRAME]
media_type=video
stream_index=0
key_frame=1
pkt_pts=120
pkt_pts_time=2.500000
pkt_dts=120
pkt_dts_time=2.500000
best_effort_timestamp=120
best_effort_timestamp_time=2.500000
pkt_duration=2
pkt_duration_time=0.041667
pkt_pos=1180981
pkt_size=137344
width=1280
height=720
pix_fmt=yuv420p
sample_aspect_ratio=N/A
pict_type=I
coded_picture_number=60
display_picture_number=0
interlaced_frame=0
top_field_first=0
repeat_pict=0
[/FRAME]

Apabila di lihat fps = 24, maka dalam 2.5 detik ada 2.5 x 24 = 60. Ini berarti:

Frame no 0 - 59 : GOP 1 (GOP duration: 2.5 detik)
Frame no 60 - 119 : GOP 2 (GOP duration: 2.5 detik)
Frame no 120 - 179: GOP 3 (GOP duration 2.5 detik)

Ingat bahwa GOP adalah jarak antara 2 keyframe (I-frame).

Apabila file tadi di transcode menjadi HLS (segmented .ts) maka ffmpeg akan membuat frame pertama pada setiap file segment .ts merupakan keyframe. Dalam 1 file .ts dapat terdiri dari 1 atau lebih keyframe. Dan apabila di periksa file asli tswift.mp4 tidak mengandung frame type B. Pada saat di conversi ke .ts maka terdapat kemungkinan file segmentnya berisi frame type B.

Apabila terdapat frame B, maka frame tsb mendahului beberapa frame P. Sebagai ilustrasi:
...
9. Frame 9: P
10. Frame 10: P
11. Frame 11: P
12. Frame 14: B
13. Frame 13: P
14. Frame 12: P
15. Frame 15: P
16. Frame 16: P
...

Seharusnya frame ke 12 adalah frame no 12. Tetapi dalam urutan penyimpanan picture atau frame, karena pada posisi ke 12 ini akan ditempati oleh frame type B (Bi Directional) maka frame 14 ini menempati tempat ke 12.

Lebih mendalam pembahasan tentang GOP menggunakan DVB Inspector bisa di baca di artikel ini.

PARAMETER FFPROBE LAIN

Hal yang bisa dilakukan untuk analisis TS adalah dengan menggunakan parameter berikut:

-show_frames : untuk menganalisis frame by frame
-show_packets : untuk menampilkan packet TS
-show_streams: untuk menampilkan jenis stream (video atau audio)

Saturday, July 4, 2015

How MPEG Works

Kita sudah mengetahui bahwa standar codec video keluarga MPEG yang sering digunakan adalah:

MPEG-1 part 2 (disebut MPEG-1)
MPEG-2 part 2 (disebut MPEG-2)
MPEG-4 part 2 (disebut MPEG-4)
MPEG-4 part 10 (disebut H.264 atau AVC)

Bagaimana cara kerja codec video tsb secara basic?

Kita sudah membahas cara kerja kompresi JPEG menggunakan DCT (Discrete Courier Transform). Pada dasarnya kompresi MPEG juga menggunakan DCT.

MPEG mendefinisikan GOP (Group of Picture), biasanya 30 (atau bisa di set saat dilakukan kompresi) dalam satu GOP. Isi dari satu GOP itu terdiri dari gambar-gambar (ada 30 gambar). Dari 30 gambar (atau di sebut 30 frame) ada 3 jenis frame:

I-frame (Intra Frame, atau Key Frame)
P-frame (Predictive Frame)
B-frame (Bi directional Frame)

Gambar yang utuh hanya I-frame. Sedangkan P-frame dan B-frame hanya selisih gambar saja.

Misal ada video latar belakang gunung, dan ada mobil melintas. Maka I-frame akan terdiri dari gambar utuh gunung dan mobil, sedangkan P-Frame dan B-frame terdiri dari gambar mobilnya saja.

Sebagai contoh lain: video orang berlari.


I-frame adalah gambar utuh pohon dan orang. P-frame adalah gambar orang yang berlari.

I-frame 1 MB apabila di kompress pakai kompresi JPEG akan menjadi 40 kb.


Sedangkan P-frame karena hanya memuat selisih gambar, maka di kompress mejadi 5 KB.


Dan B-frame karena memuat selisih 2 gambar, maka apabila di kompress akan menjadi lebih kecil lagi yaitu 1 KB.

Dari hal ini dapat dibayangkan, apabila 1 file gambar raw di kompress menjadi JPEG maka bisa didapatkan rasio kompresi 1:20, sedangkan 1 file video raw apabila dikompres MPEG-4 part 10 (sering disebut H.264) maka bisa di dapatkan kompresi 1:200. (Lebih dalam pembahasan tentang I, P, dan B frame ini dapat di baca di artikel ini).

Profiles dan Level

Mengapa MPEG-1, MPEG-2, MPEG-4, dan H.264 sama-sama pakai DCT tapi kompresi H.264 menghasilkan kompresi dengan kualitas video terbaik?

Hal ini disebabkan selain ada teknik DCT, ada seperangkat "tools" yang terus ditambahkan sejak kelahiran MPEG-1. Sebagai contoh, pada MPEG-2 tools untuk motion compensation, dan variasi sampling Kroma dimana sudah tersedia 4:2:0, 4:2:2, dan 4:4:4. Pada MPEG-4 part 2 tersedia tools untu global motion compensation, sub-pixel motion compensation, shaped coding, dsb. Sedangkan pada H.264 tersedia tools untuk Logaritmic Quantization, De-blocking fillter, dsb.
 
Gambar konversi RGB ke YUV (atau YCbCr)

Sebagaimana disebutkan sebelumnya dengan berkembangkanya teknologi MPEG (walau basisnya tetap dari DCT) semakin banyak tools yang dimasukkan di masing-masing standard. Disebabkan banyaknya tools yang tersedia, perlu di set 2 hal: Profile dan Level. Profile mendefinisikan tools apa saja yang dipakai, sedangkan Level adalah resolusi yang akan di handle.

Pada MPEG-2 dan MPEG-4 part 2, Profiles nya banyak sekali. Kemudian pada MPEG-4 part 10 (atau H.264) profilenya disederhanakan menjadi 3 saja:
- Baseline
- Main
- Extended

Baseline menggunakan tools yang terbatas. HP dengan prosesor rendah (lowspeed) biasanya hanya bisa play profile Baseline saja. Saat kita melakukan encoding (misalkan dengan ffmpeg) kita perlu mendefinisikan output file kita menggunakan profile apa. Jika kita mensasar HP low-end, maka gunakan profile Baseline. Akan tetapi karena tools yang tersedia kurang, maka kompresi yang dilakukan juga terbatas, efeknya tingkat kompresi yang dihasilkan rendah. Untuk profile diatasnya spt Main dan Extended jumlah tools lebih banyak tersedia, sehingga kompresi dilakukan dalam beberapa tahap, dengan hasil akhirnya sebuah file dengan tingkat kompresi yang tinggi.

Dengan cara pendefinisian Profile dan Level tsb, pembuat player bisa fokus membuat player nya pada Profile dan Level tertentu saja. Sebagai contoh HP iPhone versi awal kelahiran, hanya support Profile Baseline. Akan tetapi perangkat iPhone dan iPad terkini support Profile Extended.


Motion Compensation

Motion compensation adalah teknik yang digunakan untuk mereduksi bit yang dikirim. Idenya adalah dengan menganggap sebuah block pixel 8x8 bergerak dari waktu ke waktu. Sehingga informasi yang dikirim tidak perlu informasi isi (value) dari pixel 8x8, tapi cukup kordinat perubahannya.

Perhatikan gambar berikut:

Gambar I-frame adalah latar belakang. Gambar P-frame adalah gambar akhir dari sebuah mobil yang melaju. Gambar B-frame adalah gambar diantara I dan P. Terlihat bahwa B-frame bisa di dapat dengan memundurkan gambar mobil yang ada di P frame. Dengan demikian tiap blok pixel 8x8 di P-frame bisa di buatkan vektor perubahannya. Sehingga praktis B-frame hanya berisi kordinat perubahan dari blok pixel 8x8 tsb. Cara seperti ini sangat memberikan kompresi yang tinggi.

 
Bitrate pada proses Encoding/Decoding

Bitrate pada video bisa VBR maupun CBR (bedakan dengan ABR). Variable Bit Rate (VBR) biasanya digunakan oleh jaringan Kontribusi (dari Studio ke Pemancar Pusat). Sedangkan Constant Bit Rate (CBR) biasanya diguakan oleh jaringan Distribusi (dari Pemancar Pusat ke Pemancar Daerah).

VBR menghasilkan kualitas yang bagus, tetapi bandwidth transmisi yang dibutuhkan besar. Video api unggun salah satu contoh video yang detik ke detik tidak ada frame yang sama bentuk gambar api nya. Beda dengan gambar mobil bergerak diatas. Efekya api unggun biasanya kompresi yang dihasilkan rendah. Bisa di katakan bahwa pada video api unggun semua frame nya adalah I-frame. Ingat bahwa I-frame kompresi nya tidak sebagus P-frame dan B-frame. Apabila video api unggun hendak di siarkan dari Studio ke Pemancar Pusat, dengan kualitas yang bagus, maka video tsb perlu disalurkan secara VBR, sehingga saluran transmisi nya harus besar (mungkin 20 Mbps). Padahal average video dengan kualitas SD, hanya perlu saluran transmisi 3 Mbps.

Apabila saluran transmisi hanya tersedia 3 Mbps, maka video tsb perlu di transmisikan dengan CBR 3 Mbps. Efeknya adalah pada saat video api unggun muncul terjadi pixelized. Hal ini disebabkan setelah proses DCT, dan masuk ke fase Quantization nilai Quality nya dibesarkan sehingga kompresi bisa tinggi (agar bisa muat di saluran transmisi 3 Mbps) tapi gambar pixelized (tentang Quantization baca "How JPEG Works (Part-4)"). Dengan cara tsb, video tetap bisa di transmisikan dengan 3 Mbps saja, tapi ada efek, pas pergerakan cepat (spt video balapan mobil), atau gambar sangat berubah cepat (spt video api unggun), akan terjadi adalah pixelized.

De-blocking pada H.264

Salah satu kelebihan H.264 adalah adanya filter de-blocking. Akibat quantisasi yang terlalu dalam (nilai quality terlalu besar) maka tidak jarang antara blok 8x8 terjadi perbedaan warna yang tajam. De-blocking membuat pergantian warna ini lebih smooth, dengan me-rata-ratakan value antara ke dua warna tsb.


Sehingga efek pixelized pada kompresi yang sangat tinggi menjadi tidak begitu terasa, seperti contoh berikut.


Gambar kiri adalah gambar tanpa de-blocking (dimana terdapat pixelized ataupun"dust" pada wajah). Sedangkan bagian kanan setelah penerapan filter de-blocking, dimana pixelized tidak begitu terasa.