Anar al contingut

SLAM visual

De L'Enciclopèdia, la wikipedia en valencià
Archiu:Egomotion-odometry.gif
Estimació del moviment de la cambra analisant les imàgens

El mapage i localisació simultàneus o SLAM és un problema general que permet a un robot mòvil generar un mapa de l'entorn per mig de sensors, i ubicar-se en ell; i a un celular ubicar-se en el seu entorn i produir imàgens de realitat aumentada. SLAM visual és una variant especialisada de SLAM, en la que el sensor és una cambra o un conjunt de cambres, i la comprensió de l'entorn requerix tècniques de visió artificial.

Archiu:Visual SLAM ORB-SLAM2.png
SLAM visual indirecte, ORB-SLAM2.[1] A l'esquerra dos versions de la mateixa image: el cantó d'un laboratori. A la dreta s'observa una vista superior del núvol de punts del mapa. Es reconeix clarament el cantó del laboratori i les dos parets. La piràmide lila representa la localisació de la cambra en el mapa.

SLAM visual és una traducció aproximada de l'anglés visual SLAM a on l'acrònim SLAM (Simultaneous Localization And Mapping) ha cobrat significancia universal convertint-se en un nom propi, de manera que li l'adopta com anglicisme i li'l preferix front a la seua versió traduïda MYLS (Mapage I Localisació Simultàneus) que ningú utilisa.

El terme visual és una metonímia que es referix a l'anàlisis d'imàgens. És una metonímia relativament nova, en les últimes dos décades de el XX s'usava el terme òptic (com en reconeiximent òptic de caràcters) per al mateix fi.

L'acrònim SLAM és un préstam de la tecnologia de la que deriva (Mapage I Localisació Simultàneus), encara que en rigor en SLAM visual el mapage i la localisació no són simultàneus: són paralels, no estan sincronisats i les seues cadència són molt dispars. Des dels inicis en 2007 va haver intents per impondre un acrònim alternatiu més precís: PTAM,[2] que significa mapage i rastreig en paralel, pero no va conseguir impondre's. Es conclou que SLAM visual és un nom propi apartat del seu significat lliteral.

Atres térmens

[editar | editar còdic]

En la lliteratura, especialment en papers, es troben denominacions alternatives en anglés, algunes ya en desús:

  • visual SLAM
  • vSLAM
  • monocular SLAM
  • PTAM

Història

[editar | editar còdic]

El proyecte iniciador de SLAM visual va ser el publicat en el paper MONESLAM[3] en 2007 d'Andrew Davison, que va descriure el primer algoritme capaç de realisar SLAM en temps real en les imàgens d'una cambra. MONESLAM és un acrònim de monocular SLAM, que fa recalcament en l'us d'una cambra única (monocular, contrari a estereoscopía) com a únic sensor. La PC requeria GPU , l'aplicació funcionava com prova de concepte pero era molt llimitada per a usos pràctics, puix ràpidament es quedava sense memòria per lo que només podia mapear chicotetes habitacions. En posterioritat a la publicació i pel creixent interés, Davidson va compartir el còdic que es podia descarregar des de la seua pàgina.


En paralel a MONESLAM es va desenrollar PTAM,[2] publicat el mateix any a penes uns mesos més vesprada que MONESLAM. Notablement les implementacions modernes de SLAM visual adopten una estructura similar a l'introduïda per PTAM, i no ampren casi res de MONESLAM. I aixina i tot, MONESLAM es va fer més famós pel sol fet d'haver publicat primer. Esta forma d'encarar el problema de SLAM visual va rebre anys més tarde el nom de SLAM visual indirecte.

El mateix laboratori creador de MONESLAM va presentar DTAM: Donen-se Tracking and Mapping in Real-Clave, el primer sistema directe que no es concentra en punts sino que utilisa l'image completa, denominant per oposició SLAM visual indirecte al restant dels sistemes.

2014 a 2017

[editar | editar còdic]

En 2014 l'Universitat Tècnica de Munich (TUM) va publicar LSD-SLAM,[4] Large Scale Direct SLAM,[5] iniciant la categoria SLAM visual semidirecto i marcant una fita històrica: va ser el primer sistema capaç d'eixecutar-se en temps real en una PC sense GPU i dels primers en publicar el seu còdic font com còdic obert, lo que va facilitar l'instalació i prova a mils d'aficionats que varen popularisar les possibilitats de SLAM visual. A partir de LSD-SLAM els sistemes de SLAM visual s'abocarien a l'us en temps real sense GPU en una PC i a publicar el seu còdic font obert per a conseguir el respal de la comunitat en la seua depuració i millora.

ORB-SLAM[6] (2015) i ORB-SLAM2[7] (2017) publicats com a còdic obert i en sengles papers de Raúl Mur de l'Universitat de Saragossa varen marcar l'estat de l'art. En posterioritat molts sistemes de SLAM visual es basarien en ORB-SLAM2.

En 2017 el mateix autor va publicar Visual-inertial SLAM,[8] estenent ORB-SLAM2, per a combinar cambra en IMU, un dels primers sistemes de la nova categoria SLAM visual i inercial, i sense dubte el més influent.

Estat de l'art en 2021

[editar | editar còdic]

En 2017, a 10 anys del proyecte iniciador MONESLAM, el problema de SLAM visual es va considerar resolt. La cantitat de publicacions i sistemes continua en aument, i es dediquen refinament i millores incrementals per un costat, i a l'exploració d'un camp nou en l'us de deep learning.

ORB-SLAM2 i LSD-SLAM representen l'estat de l'art i són els grans pilars de les categories de sistemes indirecte i semidirecto . ORB-SLAM2 sembla haver presentat millor base per a refinament i desenroll de característiques superiors, i s'usa com a base per a millores paulatines, com ho demostren ORB-SLAM3 (2021), SVDL (2019) i OpenVSLAM (2019), tres proyectes destacats entre molts uns atres.

Referències

[editar | editar còdic]


Referències

[editar | editar còdic]