Počítačové vidění:
Proč auto vidí nepozná značku?

Marketingové brožury slibují revoluční autonomní řízení, ale realita je omezena na interpretaci matice čísel. Pokud si myslíte, že kamera "vidí" stopku stejně jako vy, mýlíte se. Jsou to jen pixely a statistická pravděpodobnost, která selhává při prvním náznaku šumu.

Zjistit pravdu o algoritmech
A high-contrast technical photo of a car camera sensor lens

Redukce na surová data

Když kamera zachytí dopravní značku, algoritmus ji okamžitě rozseká na kanály RGB. Neexistuje žádný koncept "tvaru" v lidském smyslu. Systém hledá shluky čísel, které odpovídají naučeným vzorcům. Pokud je matice poškozena digitálním šumem nebo nízkým rozlišením, pravděpodobnost shody prudce klesá. Tato mechanická povaha je důvodem, proč i banální chyba v datech vede k fatálnímu selhání.

Více o matematice sítí →

Problém komprese

Většina systémů používá ztrátovou kompresi, aby ušetřila výpočetní výkon. Tím se smazávají jemné detaily, které jsou pro správnou identifikaci klíčové. Pro marketéra je to "optimalizace", pro inženýra je to riskantní hazard s přesností. Jakmile algoritmus ztratí hranu objektu v artefaktech komprese, přestává rozlišovat mezi značkou "Dej přednost v jízdě" a náhodným billboardem.

Proč data lžou →

Selhání detekce hran

Detekce hran je základním pilířem počítačového vidění. Algoritmy jako Cannyho detektor hledají prudké změny v intenzitě pixelů. Problém nastává v momentě, kdy je scéna vizuálně komplexní. Stíny stromů dopadající na vozovku vytvářejí pro stroj "falešné hrany", které mají stejnou matematickou váhu jako vodorovné dopravní značení.

Proč je to kritické? Protože stroj neví, co je stín a co je fyzický objekt. On pouze počítá gradienty. Pokud je kontrast mezi asfaltem a stínem vyšší než mezi asfaltem a vybledlou čárou, auto se rozhodne následovat stín. To není chyba "inteligence", ale logický důsledek toho, jak je systém navržen. Marketingové sliby o bezchybném vnímání okolí narážejí na fyzikální limity optiky.

"Počítačové vidění není o chápání světa, ale o hledání statisticky nejméně nepravděpodobné interpretace šumu."

Dalším faktorem je tzv. "přetržení hran". Pokud je značka částečně zakrytá větví nebo nálepkou, algoritmus nedokáže logicky doplnit chybějící část jako lidský mozek. Vidí dva nesouvisející objekty. V ten moment systém buď objekt ignoruje, nebo jej klasifikuje jako něco úplně jiného. Je to mechanický proces, který postrádá jakoukoli formu kontextuálního uvažování.

Světelný scénář Reakce senzoru Následek pro systém
Přímé protisvětlo (slunce) Saturace pixelů (whiteout) Úplná slepota v daném sektoru
Rychlé střídání světla a stínu Pomalá adaptace expozice Zpoždění v detekci objektů o stovky ms
Umělé osvětlení (LED) Flicker efekt (blikání) Zmatení algoritmu, značky "mizí"
Mokrá vozovka v noci Spekulární odrazy Detekce neexistujících jízdních pruhů

Proč HDR nepomáhá?

Většina lidí si myslí, že HDR (High Dynamic Range) vyřeší vše. V automotive segmentu ale HDR znamená skládání více snímků, což vede k pohybovému rozmazání (motion blur). U auta jedoucího 130 km/h je každý milimetr pohybu během expozice kritický. Výsledkem je sice hezký obrázek pro oko, ale nepoužitelná mazanice pro algoritmus detekce hran.

Limity klasifikace objektů

Posledním krokem je klasifikace – přiřazení štítku k detekovanému shluku pixelů. Zde narážíme na problém "přetrénování". Pokud byl model trénován na 10 000 fotkách čistých německých značek, bude mít problém s jednou zrezivělou značkou u českých silnic. Stroj nemá schopnost abstrakce. Nechápe, že "zrezivělý osmiúhelník" je stále "STOP".

  • Adverzní útoky: Stačí malá, pro člověka neviditelná samolepka na značce, a klasifikátor ji vyhodnotí jako úplně jiný objekt (např. rychlostní omezení místo stopky).
  • Chybějící kontext: Auto nepozná, že značka je na korbě náklaďáku před ním a neplatí pro něj. Vidí značku, reaguje brzděním.
  • Sémantická propast: Rozdíl mezi tím, co detekuje senzor, a tím, co situace vyžaduje, je stále příliš velký pro současné lineární algoritmy.

Dokud nebudou systémy schopny pracovat s kontextuální logikou namísto pouhého porovnávání vzorů v matici, zůstane plná autonomie jen marketingovým snem. Počítačové vidění je fascinující nástroj, ale jeho slepá místa jsou mnohem větší, než si většina uživatelů připouští. Více o tom, jak fungují jazykové modely a proč mají podobné limity, se dozvíte v naší další sekci.

Chcete vidět pod kapotu technologií?

Přestaňte věřit magii marketingu a začněte rozumět technické realitě dnešního světa. Naše analýzy jdou k jádru věci.