Jak software pro rozpoznávání obsahu řeší problém odhalování porušení autorských práv

2

Stojíte ve frontě na nápoje a občerstvení. Soundtrack nabobtná a jedna ze skladeb zní tak silně, že se zastavíte a posloucháte. Máš ji rád. Ale neznáte název písně ani jméno interpreta.

Takže vytáhnete telefon. Vytočíte číslo. Umístěte telefon na reproduktor. O několik sekund později přijde textová zpráva: název skladby, jméno interpreta, odkaz na nákup. Připraveno.

Není to magie. Toto je software pro rozpoznávání obsahu.

Tyto programy umí více než jen identifikovat skladby hrané v kinech. Stávají se hlavním prostředkem ochrany proti porušování autorských práv. Pro nezávislé umělce a velké korporace je to skutečná spása. Internet usnadnil přístup k obsahu bez placení. Peers (P2P sítě). Služby sdílení souborů. YouTube. Největší hráči.

Až donedávna neměly společnosti jinou možnost, než se spoléhat na to, že porušení odhalí lidé. Byl to ruční lov. Zaměstnanci museli prohledávat platformy a hledat proprietární videa. Museli vypracovat zprávy. Bylo to vyčerpávající. Neefektivní. Pomalu.

YouTube například často spoléhá na to, že uživatelé nahlásí nevhodný materiál. Ale porušování autorských práv není vždy „nevhodné“ z morálního hlediska. Jsou prostě nelegální. A ne každý uživatel chápe rozdíl.

Proto byla většina společností nucena spoléhat na zaměstnance, kteří identifikují fragmenty videa a kompletní dokumentaci. Tento proces bude brzy zastaralý.

Vývoj softwaru

Přechod z ruční detekce na automatické rozpoznávání vše mění. Namísto čekání na stížnost od uživatele může software skenovat miliony stažených souborů v reálném čase. Porovnává zvukové a obrazové otisky s databází známých děl.

Tak to funguje. A proč je to důležité?

Společnosti nasazují nástroje, které skenují zvukové a obrazové nahrávky proti obrovským databázím, aby identifikovaly materiál chráněný autorským právem. Jedná se o levný a efektivní způsob ovládání internetu, mnohem efektivnější než doufat, že někdo z vašich přátel rozpozná skladbu hrající v kavárně.

Vytvoření takového softwaru není snadný úkol. Soubory jsou dostupné v desítkách formátů. Soubor WAV a jeho protějšek MP3 jsou na úrovni kódu zcela odlišné. I ve stejném formátu se bitrate může lišit. Dva soubory MP3 se stejnou skladbou se nemusí shodovat kvůli rozdílům v kompresi. Záznamy z telefonu zvyšují hluk a problémy s kvalitou.

Piráti také mění zdrojový materiál. Natáčejí filmy v kinech pomocí ručních kamer. Některé projektory digitálně zaznamenávají obraz z promítací kabiny. Ostatní oříznou nebo upraví video. Jednoduché porovnání kódu zde nefunguje. Identifikátory musí zohledňovat tyto zkreslení.

Software pro rozpoznávání obsahu – Audio

Rozpoznávání zvuku vyžaduje jiný přístup než pouhé porovnávání zdrojového kódu. Cílem je rozpoznat obsah, nikoli obal souboru.

Algoritmy hledají jedinečné vzory ve zvukových vlnách. Tyto vzory jsou zachovány, i když je soubor převeden nebo komprimován. Systém vytvoří „otisk“ kompozice. Tento otisk ignoruje hluk na pozadí. Je odolný proti špatné kvalitě záznamu. Funguje to i při menších změnách tempa.

Tato metoda řeší problém s formátem. Nezáleží na tom, zda je vstupním souborem MP3, AAC nebo nekvalitní nahrávka z telefonu. Hlavní melodie a rytmus zůstávají detekovatelné.

Proces zahrnuje extrakci klíčových spektrálních prvků. Jedná se o charakteristické vrcholy a prohlubně ve frekvenčním spektru zvuku. Software porovnává tyto charakteristiky se známou knihovnou. Zápas spustí varování. To umožňuje platformám automaticky blokovat nebo zpeněžit obsah.

Přesnost je hlavním problémem. Falešná pozitiva plýtvají zdroji. Falešné propustky umožňují, aby pirátství nebylo odhaleno. Nejlepší systémy vyvažují citlivost a přesnost. Učí se na základě zpětné vazby od uživatelů. To zlepšuje detekci v průběhu času.

Protože rozpoznávání videa sleduje podobnou logiku, sázky se zvyšují. Video obsahuje vizuální data. To přidává na složitosti. Ale u zvuku se zaměřujeme na zachování „duše“ písně. Díky tomu je rozpoznatelná.

Vytváření databáze obsahu začíná jednoduchým předpokladem: potřebujete něco, s čím byste mohli porovnávat. Pro nahrávací společnost je to „něco“ celý katalog předchozích nahrávek. Software nejen čte metadata. “Poslouchá”. Analyzuje samotnou zvukovou vlnu a vytváří jedinečnou digitální značku známou jako otisk prstu nebo podpis.

Tento proces ignoruje formát kódování souboru. Považuje za čistý zvuk. Některé nástroje se zaměřují na tempo a rytmické vzory. Jiní měří amplitudu a frekvenci. Software obvykle zachytí několik sekund vzorků z nahrávky a vytvoří profil. Někteří konkurenti analyzují celé sekce pro maximální přesnost. Jeden konkrétní produkt hledá orientační body – charakteristické akustické momenty – a poté studuje zvuk kolem nich. Cíl je jednoduchý. Pokud jsou orientační body jasné, skenování by mělo být snadné.

Za hudbou stojí matematika

Tyto programy se při skutečné práci spoléhají na algoritmy. Většina z nich používá Fast Fourier Transform (FFT) algoritmus. Je to matematická metoda, která rozkládá složité signály. Sleduje změny v datech. FFT to zobrazí, ať už jde o posun tempa, změnu počtu úderů za minutu nebo kolísání amplitudy. Výsledek je převeden na číselný otisk prstu.

Jakmile je databáze naplněna, může ji společnost použít ke dvěma hlavním účelům: pomoci zákazníkům najít skladby nebo najít porušení autorských práv. Metoda zůstává nezměněna. Software bere neznámý zvukový fragment. Analyzuje to stejně jako položky adresáře. Generuje hash – krátký kód založený výhradně na obsahu zvuku. Tento nový otisk pak porovná s uloženými. Dalším krokem je definování odpovídající logiky.

Filtrace pro lidské ucho

Aby bylo zajištěno, že software bude fungovat bez ohledu na formát souboru, programátoři vstupní data filtrují. Zaměřují se pouze na zvuky v dosahu lidského sluchu. To odráží, jak funguje komprese MP3. Soubory MP3 jsou malé, protože snižují frekvence, které lidé stejně neslyší. Software pro rozpoznávání obsahu dělá to samé. Ignoruje celý rozsah původní nahrávky. Pokud to neudělá, nemusí odpovídat méně kvalitním verzím MP3 stejné skladby. Systém musí mluvit stejným akustickým jazykem jako komprimované soubory, které uživatelé skutečně vlastní.

Zvukové klipy zřídka dorazí v perfektním stavu. Systém můžete nakrmit zkrácenou smyčkou, cover verzí nebo pasáží, která přechází do melodie jiné písně. Zde vstupují do hry algoritmy. Jejich úkolem je vzít příchozí zvukový otisk a najít shodu v databázi. Nehledají jen přesné kopie. Hledají shody v určitém rozmezí pravděpodobnosti.

Představte si kriminalistiku starého stylu. Před příchodem sofistikovaného softwaru odborníci ručně přiřazovali podezřelé na místa činu. Hledali body podobnosti. Dříve musel specialista najít alespoň 16 odpovídajících bodů, aby to považoval za shodu. Moderní software dělá něco podobného, ​​ale místo počítání bodů počítá pravděpodobnost.

Neexistuje jednotná norma pro to, jak velké překrytí je považováno za shodu. Většina platforem pro rozpoznávání obsahu umožňuje nastavení citlivosti. Chcete dostávat pouze nepopiratelné zápasy? Nastavte práh na 95 procent nebo vyšší. Pokud si algoritmus není jistý, nebude to jen hádat. Uživateli odešle chybovou zprávu. Tento práh můžete také snížit, pokud potřebujete detekovat blízké shody, i když to přináší vyšší riziko falešných poplachů.

Jakmile software označí shodu, začíná skutečná práce. Do hry vstupuje partnerská aplikace. Dokáže extrahovat název skladby pro aplikaci pro vyhledávání hudby. Nebo může upozornit správce webu. Hudební společnosti používají tuto technologii ke skenování sítí pro sdílení souborů. Monitorují stránky pro streamování zvuku kvůli ochraně autorských práv. Celá analýza trvá několik sekund.

Software pro rozpoznávání obsahu – Video

Video přidává úroveň složitosti, kterou zvuk nemá.

Jak rozpoznávání obsahu videa bojuje proti pirátství na YouTube

Videotisky nejsou žádnou novinkou. Rozpoznávání zvuku již roky tiše sleduje hudbu a reklamy. Funguje tak, že převádí zvukové vlny na digitální otisk prstu. Systém poté prohledá databázi a najde shodu.

S videem je situace složitější. Sázky jsou vyšší a překážky fyzické.

Společnosti Time Warner a Disney testovaly nové nástroje Google pro identifikaci videa na YouTube. Cíl byl jednoduchý: odhalit stahování filmů a televizních pořadů chráněných autorským právem dříve, než se rozšíří. Obrazová data se však chovají jinak než zvuková data. Jsou chaotické, mění se a jsou často odříznuté.

Problém s krátkými fragmenty

Většina videí na YouTube byla během testování omezena na 10 minut nebo 100 megabajtů. Toto omezení vytváří obrovskou mezeru. Jeden fragment může být libovolných 10 minut dvouhodinového filmu.

Software musí rozpoznat tento malý fragment v rámci celé práce. Přesný algoritmus Google nezveřejnil. Pravděpodobnou metodou je rozdělit původní chráněné dílo na překrývající se fragmenty. Každý fragment dostává svůj vlastní otisk.

Při zavádění systému jsou tyto fragmenty kontrolovány proti knihovně. To je úkol najít jehlu v kupce sena. Jehla je malá. Snop je obrovský. A neustále roste.

Instalace a přemostění ochrany

Nakladače nejsou pasivní. Snaží se rozbít systém.

Jednoduché změny mohou oslepit základní nástroje rozpoznávání. Změna sytosti barev? Díky tomu je shoda založená na barvě matoucí. Oříznutí rámečku? Odstraňuje kontext.

Pak jsou tu piráti. Některé nahrávají filmy přímo z plátna kina. Jiní používají ruční fotoaparáty v nevhodných úhlech. Obraz se třese. Je nakloněný. Je to zkreslené.

Standardní mapování oprávnění zde nefunguje. Na dokonalé přizpůsobení pixelů se nelze spolehnout. Video YouTube není nic jako hlavní soubor v databázi studia.

Analýza pohybu jako řešení

Vývojáři se obrátili na hnutí. Místo toho, aby se jen dívali na statické snímky, analyzují, jak se pixely pohybují.

Software sleduje změny jízdních vlastností. I když jsou barvy špatné nebo je rám oříznut, základní pohyb objektů zůstává podobný. Auto jedoucí po ulici se pohybuje stejným způsobem, bez ohledu na chvění kamery nebo korekci barev.

Tento přístup je slibný. Tohle není stříbrná kulka. Ruční nahrávání představuje chaotický pohyb, který může stále zmást algoritmy. Někdy musí být rozsah pravděpodobnosti shody široký. Široké shody znamenají více falešných poplachů.

Lidský faktor zůstává

Zvýšená účinnost neznamená plnou automatizaci.

Filmová studia mohou stále potřebovat skutečné lidi, aby zkontrolovali označené klipy. Software hlásí potenciální pirátství. Muž to potvrzuje.

Jedná se o hybridní model. Počítač dělá těžkou práci. Během několika sekund prohledá miliony stažení. Zúží své hledání. Lidé pak kontrolují shody. Tento pracovní postup je rychlejší než ruční kontrola. Není to okamžité. Je to prostě chytřejší.

Údržba databáze na dobu neurčitou

I když technologie funguje perfektně, logistika je brutální.

Identifikace videa je v současné době ve fázi testování. Některé společnosti předvádějí ukázky. Ostatní dodávají nástroje. Ale práce není nikdy hotová.

Každý den vycházejí nové filmy. Epizody televizního pořadu se vysílají každý týden. Studia musí své tisky neustále aktualizovat. Databáze slavného obsahu roste bez omezení.

Detekce pirátství není jednorázová oprava. Toto je cyklus údržby. Vyžaduje neustálou péči. Objem videoobsahu je skutečný nepřítel. Technologie to pomáhá zvládat. Nevylučují to potřebu.

Často kladené otázky

Co je rozpoznávání obsahu videa?
Jedná se o software, který vytváří digitální otisk prstu z video snímků. Porovná tento otisk s databází, aby identifikoval materiál chráněný autorským právem. Poradí si s problémy, jako je oříznutí, změny barev a chvění fotoaparátu.

Jak funguje snímání otisků prstů u videa založeného na pohybu?
Analyzuje pohyb pixelů a objektů ve videoklipu. To pomáhá identifikovat obsah, i když je změněna vizuální kvalita nebo je záznam přenášen z ruky.

Kdo vyvíjí software pro identifikaci videa?
Google na testování spolupracoval s Time Warner a Disney. Společnosti jako Audible Magic, MotionDSP a Relatable také poskytují podobné nástroje pro rozpoznávání obsahu.