Intervju med Wang Yaonan, akademiker ved Chinese Academy of Engineering: Kunstig intelligens gjør maskinsyn intelligent

May 07, 2024 Legg igjen en beskjed

Takket være utviklingen av kunstig intelligens drevet av den store språkmodellen, har forskning og anvendelse av grafisk ikonografi innledet en ny mulighet, som fremmer utviklingen av stor språkmodell til stor visjonsmodell." 30. desember 2023, den i anledning nyttårsaften og nyttårsdag delte Wang Yaonan, akademiker ved Chinese Academy of Engineering og direktør for National Engineering Research Center for Robot Visual Perception and Control Technology, de siste trendene innen utvikling av maskinsynsintelligens på den 19. Young Scientists Conference of the Chinese Society of Graphic Graphics.

 

I et eksklusivt intervju med Nandu-reporteren sa Wang Yaonan at kunstig intelligens gjør maskinsyn intelligent, og høyere aritmetisk kraft kan støtte opplæring av store visuelle modeller. Smartere store visjonsmodeller trenger imidlertid også høyere aritmetiske nivåer, bedre modellarkitekturer og mer effektive læringsalgoritmer.

 

Denne konferansen er organisert av Chinese Society of Image Graphics, Pazhou Lab, South China University of Technology, Sun Yat-sen University og Youth Working Committee of the Chinese Society of Image Graphics.

 

Snakker om bransjetrender

 

Fra visuell databehandling til visuell intelligens

 

Yao-Nan Wang: Kinas maskinsynsforskning har en historie på nesten 40 år, opprinnelig fra studiet av sensorer, det vil si: å konvertere lysinformasjon til bildeinformasjon. Den neste tingen å gjøre er behandlingen av synet, inkludert forbedring av det oppnådde bildet for å gjøre det klarere.

 

Etter å ha et klart bilde, må vi hente målet vi er interessert i fra bildet. For eksempel, innen førerløs kjøring, må maskinsyn oppdage målene på bildet, for å svare på spørsmålet om hvem som er en person og hvilken som er en bil.

 

Dette er det vi kaller de tre hovedområdene for maskinsyn. Jeg koker det ned til: bildebehandling, bearbeiding og forståelse.

 

Maskinsyn har flyttet seg fra visuell databehandling tidligere til visuell intelligens i dag. Visuell databehandling kombinert med kunstig intelligens har forbedret kognisjonsnivået og forbedret evnen til å forstå komplekse miljøer, og hele den visuelle intelligensindustrien har hatt en rivende utvikling det siste året.

 

Retningen for utviklingen av maskinsynsintelligens er å utføre et bredt spekter av applikasjoner, brukt på industriell inspeksjon, intelligent produksjon og satellittfjernmåling og andre felt.

 

Når vi snakker om maskinsyn, må vi snakke om applikasjonen, applikasjonsdrevet teknologiutvikling. Chinese Society of Image Graphics har 30 spesialkomiteer, hovedsakelig sentrert på grafiske bilder for å utføre forskning, for å tjene den nasjonale økonomien. Disse teknologiene har et bredt spekter av bruksscenarier, inkludert industri, landbruk, geografiske informasjonssystemer, fjernmåling, landressurser og så videre.

 

En person kan se verden ved fødselen og forstå verden etterpå, og 80 % av informasjonen tilegnes ved syn. Maskinsyn er å simulere det menneskelige øyet, og til slutt nå nivået til det menneskelige øyet, og i noen aspekter overgå det menneskelige øyet, for å se lenger, se klarere.

 

Snakk om stor visjonsmodell

 

Stor visuell modell vil bli mer og mer intelligent

 

Yao-Nan Wang: Big Language Model er en datadrevet AI som bruker kunnskap fra bøker, språk og tekst som data for å trene en nevrale nettverksmodell som kan resonnere og svare basert på det den har lært.

 

Dataene for den store visuelle modellen kommer derimot hovedsakelig fra ulike bilder, inkludert visuelle data generert av mennesker og natur. For eksempel er den medisinske store visuelle modellen å legge inn bildene av menneskelige organer og lesjoner som visuelle data i den store modellen, og deretter trene for å få den, slik at den kan lese CT-bilder som en lege, og kan oppnå effekten av resonnere pasientens tilstand etter å ha tatt bilder når pasienten kommer til legen.

 

Den nåværende visuelle modellen har ikke det samme som den menneskelige hjernen som vi forestiller oss, gapet er fortsatt veldig stort. Med økningen av læringsdata og justering av modellparametere, vil modellen bli større og større og mer og mer kunnskap, og dens intelligensnivå vil bli høyere og høyere og smartere.

 

Vi må øke nivået av aritmetisk kraft og akselerere beregningshastigheten for å kunne bygge modeller raskere; å designe bedre modellarkitekturer, inkludert mer tolkbarhet og sikrere og kontrollerbare; og å forske på mer effektive læringsalgoritmer.

 

Faktisk er visuell makromodellering ikke ny de siste årene, den har blitt utviklet steg for steg. På 1980-tallet, med utviklingen av kunstig intelligens, begynte folk å studere nevrale nettverk. Det er bare det at de siste årene har aritmetiske og algoritmiske evner økt, slik at folk kan prøve å bygge store modeller, noe som gir opphav til store språkmodeller og store visuelle modeller. Før i tiden, da det ikke var nok aritmetisk kraft, laget folk ikke så store modeller.

 

Snakker om utsiktene for 2024

 

Vi håper virksomheten vil vokse fra Guangzhou til hele landet og verden.

 

Yaonan Wang: Hunan Universitys nasjonale ingeniørforskningssenter for robotvisuell persepsjon og kontrollteknologi har flyttet til Guangzhou Zengcheng, som ligger i Guangdong-Hong Kong-Macao Greater Bay Area, i 2022, og etablerte HU Guangdong-Hong Kong-Macao Greater Bay Area Innovation Research Institute (Guangzhou Zengcheng).

 

Instituttet fokuserer på forskning og anvendelse av intelligent syn for maskiner, inkludert spesielle operasjonsroboter innen intelligent produksjon, medisinsk og farmasøytisk, samt generaliserte store synmodeller. For eksempel brukes disse undersøkelsene til produksjonsindustrien, som kan erstatte et stort antall arbeidere og fullføre inspeksjonen av produktkvalitet, spesielt i 3C og high-end deleindustri. For tiden har instituttet utviklet programvare- og maskinvaresystemer, hvis hovedfunksjon er å styrke den digitale og intelligente transformasjonen av Guangdong-bedrifter og fremme utviklingen av produksjonsindustrien.

 

I tillegg utfører instituttet også intelligente maskinsyn og kontrollsystemer, som hovedsakelig brukes i produksjon av avansert intelligent utstyr, for eksempel industriell Internett-programvare, som har et svært stort antall algoritmer.

 

Guangdong er i forkant av reformer og åpne opp og den viktigste økonomiske slagmarken, med en komplett industriell kjede og forsyningskjede, og mange produksjonsbedrifter, kom vi til Guangdong layout først på grunn av markedets etterspørsel. I tillegg har vårt forskningssenter har en rekke FoU-team i Guangdong har landet en rekke prosjekter, transformasjon av vitenskapelige og teknologiske prestasjoner.

 

I første halvdel av 2023 møtte vi noen utfordringer, hovedsakelig innen leveranse av deler og komponenter. I 2024 tror jeg at disse problemene vil bli løst, og industrikjeden, forsyningskjeden og FoU-evnen til Guangdongs AI-industri vil bli forbedret. I det store hjemmemarkedet vil det åpnes nye spor. I en levende atmosfære, hvor alle tar initiativ, handler og nyter, kan alle utfordringene løses.

 

Jeg er trygg på utviklingen av AI-industrien i Guangdong. I løpet av de siste 30 årene har vi gjort en stor innsats for å være selvhjulpne innen vitenskap og teknologi og samlet mange vitenskapelige forskningsresultater. Guangdong er den største økonomiske provinsen i Kina.

 

Feltet kunstig intelligens og robotikk som vi er engasjert i, har fanget opp en god mulighet, som har vokst eksplosivt de siste to årene, bringer inn mange nye markeder og trekker inn nye industrielle spor. Det vil bli flere og flere smarte terminaler i fremtiden, noe som også vil føre til utvikling av produksjonsanlegg og utstyrsindustrien. I 2024 håper jeg at forskningsinstituttet vårt i Zengcheng, Guangzhou vil være i stand til å ta virksomheten vår til hele landet og verden.