Anar al contingut

Base de senyes MNIST

De L'Enciclopèdia, la wikipedia en valencià
Archiu:MnistExamplesModified.png
Imàgens de mostra del conjunt de senyes de prova MNIST

La base de senyes MNIST (per les seues sigles en anglés, Modified National Institute of Standards and Technology database)[1] és una extensa colecció de base de senyes que s'utilisa àmpliament per al entrenament de diversos sistemes de processament d'imàgens.[2][3] També s'ampra en freqüència en el camp del aprenentage automàtic per a tasques d'entrenament i prova.[4][5]

Esta base de senyes va ser creada per mig de la combinació de mostres dels conjunts de senyes originals de l'Institut Nacional d'Estàndarts i Tecnologia (National Institute of Standards and Technology o NIST, en anglés).[6] Els creadors varen prendre esta decisió considerant que el conjunt d'entrenament de el NIST provenia d'empleats de l'Oficina del Cens nortamericà, mentres que el conjunt de prova s'obtenia d'estudiants de secundària nortamericanes, lo que no era adequat per a experiments d'aprenentage automàtic.[7] Ademés, les imàgens en blanc i negre de el NIST varen ser normalisades per a ajustar-se a un quadro delimitador de 28x28 píxels i es varen suavisar, lo que va introduir nivells d'escala de grises.[7]


La base de senyes MNIST consta de 60.000 imàgens d'entrenament i 10.000 imàgens de prova.[8] La mitat de les imàgens d'entrenament i la mitat de les imàgens de prova es varen obtindre del conjunt de senyes d'entrenament de el NIST, mentres que l'atra mitat es va prendre del conjunt de senyes de prova de el NIST.[9] Els creadors originals de la base de senyes tenen una llista d'alguns dels métodos que es varen provar en ella.[7] En el seu document original, varen utilisar una màquina de vectores de soport per a conseguir una taxa d'error del 0,8%.[10]

El MNIST Estés (en anglés, Estendre MNIST o EMNIST) és un nou conjunt de senyes desenrollat i publicat per el NIST com a successor (definitiu) de MNIST.[11][12] Mentres que MNIST solament incloïa imàgens de dígits manuscrits, EMNIST inclou totes les imàgens de la Base de Senyes Especial 19 de el NIST, que comprén tant lletres mayúscules com a minúscules, ademés de dígits.[13][14] Les imàgens de EMNIST s'han convertit al mateix format de 28x28 píxels i s'han aplicat el mateix procés de normalisació que es va utilisar en MNIST. Per lo tant, és provable que les ferramentes que funcionen en el conjunt de senyes MNIST, que és més antic i més menut, també funcionen sense modificacions en EMNIST.

Història

[editar | editar còdic]

El conjunt d'imàgens de la base de senyes MNIST va ser creat en 1994 per mig de la combinació de dos bases de senyes de el NIST: la Base de Senyes Especial 1 i la Base de Senyes Especial 3. La Base de Senyes Especial 1 conté dígits escrits per estudiants de secundària, mentres que la Base de Senyes Especial 3 consistix en dígits escrits per empleats de l'Oficina del Cens d'Estats Units.[7]


El conjunt de senyes original consistia en imàgens binarias de 128x128 píxels, les quals varen ser processades i convertides en imàgens de 28x28 píxels en escala de grises. Inicialment, tant el conjunt d'entrenament com el conjunt de proves contenien 60.000 mostres cada u. No obstant, posteriorment es varen descartar 50.000 mostres del conjunt de proves.[15]

Rendiment

[editar | editar còdic]

Alguns investigadors han alcançat un "rendiment casi humà" en la base de senyes MNIST utilisant un comité de rets neuronals. En el mateix artícul, els autors conseguixen un rendiment que duplica el dels humans en atres tasques de reconeiximent.[16] La taxa d'error més alta registrada[7] en el lloc web original de la base de senyes és del 12%, i es conseguix utilisant un classificador llineal simple sense preprocesamiento.[10]

En 2004, experts varen conseguir alcançar una taxa d'error del 0,42% en el millor dels casos utilisant un nou classificador cridat LIRA. Este classificador és un classificador neuronal que consta de tres capes de neurones i es basa en els principis del perceptrón de Rosenblatt.[17]

Alguns investigadors han evaluat sistemes d'inteligència artificial utilisant la base de senyes MNIST somesa a distorsió aleatòries. En estos casos, els sistemes solen ser rets neuronals i les distorsió amprades solen ser transformacions afins o deformacions elàstiques.[7] En ocasions, estos sistemes han tingut molt èxit, com en el cas en el que es va conseguir una taxa d'error en la base de senyes del 0,39%.[18]


En 2011, es va reportar una taxa d'error del 0,27%, millorant el millor resultat previ, per mig de l'us d'un sistema similar de rets neuronals.[19] En 2013, es va afirmar que un enfocament basat en la regularisació de les rets neuronals utilisant DropConnect conseguia una taxa d'error del 0,21%.[20]

En 2016, es va alcançar el millor rendiment fins al moment en una sola ret neuronal convolucional, en una taxa d'error del 0,25%.[21] En agost de 2018, la millor taxa d'error registrada en una sola ret neuronal convolucional entrenada en senyes d'entrenament MNIST sense aument de senyes va ser del 0,25%.[21][22] Ademés, el Parallel Computing Center (Khmelnytskyi, Ucrània) va conseguir un conjunt de sol 5 rets neuronals convolucionales que varen alcançar una taxa d'error del 0,21% en MNIST.[23][24]

És important tindre en conte que algunes imàgens del conjunt de senyes de prova poden ser a penes llegibles i açò pot dificultar alcançar taxes d'error de prova del 0%.[25] En 2018, investigadors del Departament d'Ingenieria de Sistemes i Informació de l'Universitat de Virginia varen anunciar un error del 0,18% utilisant tres tipos de rets neuronals apilades simultàneament: rets neuronals totalment conectades, recurrents i convolucionales.[26]


Referències

[editar | editar còdic]
  1. «THE MNIST DATABASE of handwritten digits». Yann LeCun, Courant Institute, NYU Corinna Corts, Google Labs, New York Christopher J.C. Burges, Microsoft Research, Redmond.
  2. «Support vector machines speed pattern recognition - Vision Systems Design» (en inglés). Vision Systems Design. Consultat el 17 d'agost de 2013.
  3. «Handwritten digit database» (en inglés). cis.jhu.edu. Consultat el 17 d'agost de 2013.
  4. «THE MNIST DATABASE of handwritten digits» (en inglés). gavo.t.o-tokyo.ac.jp. Consultat el 18 d'agost de 2013.
  5. Advances in Neural Information Processing Systems.
    557-563.Consultat el 18 d'agost de 2013.
  6. «NIST Special Database 19 - Handprinted Forms and Characters Database» (en inglés). National Institute of Standards and Technology.
  7. 7,0 7,1 7,2 7,3 7,4 7,5 «The MNIST Handwritten Digit Database» (en inglés). Yann LeCun's Website yann.lecun.com. Consultat el 30 d'abril de 2020.
  8. Image and Vision Computing.22
    971-981.doi:10.1016/j.imavis.2004.03.008.
  9. IEEE Transactions on Pattern Analysis and Machine Intelligence.26
    525-528.doi:10.1109/TPAMI.2004.1265868.Consultat el 20 d'abril de 2020.
  10. 10,0 10,1 Proceedings of the IEEE.86
    2278-2324.doi:10.1109/5.726791.Consultat el 18 d'agost de 2013.
  11. «The EMNIST Dataset» (en inglés). NIST. Consultat el 11 d'abril de 2022.
  12. «NIST Special Database 19» (en inglés). NIST. Consultat el 11 d'abril de 2022.
  13. Plantilla:Cite arXiv
  14. Plantilla:Cite arXiv
  15. Curran Associates, Inc..32Consultat el Advances in Neural Information Processing Systems.
  16. Ciresan, Donen; Meier, {{{nom2}}}; Schmidhuber, {{{nom3}}} (2012). «Multi-column deep neural networks for image classification», 2012 IEEE Conference on Computer Vision and Pattern Recognition (en Anglés), pp. 3642-3649. doi:10.1109/CVPR.2012.6248110. ISBN 978-1-4673-1228-8.
  17. Image and Vision Computing.22
    971-981.doi:10.1016/j.imavis.2004.03.008.Consultat el 20 de setembre de 2013.
  18. Advances in Neural Information Processing Systems.19
    1137-1144.Consultat el 20 de setembre de 2013.
  19. Ciresan, Donen Claudiu; Meier, {{{nom2}}}; Gambardella, {{{nom3}}}; Schmidhuber, {{{nom4}}} (2011). «Convolutional neural network committees for handwritten character classification», 2011 International Conference on Document Analysis and Recognition (ICDAR) (en Anglés), pp. 1135-1139. doi:10.1109/ICDAR.2011.229. ISBN 978-1-4577-1350-7.
  20. 21,0 21,1 «Lets Keep it simple, Using simple architectures to outperform deeper and more complex architectures» (en inglés). github. Consultat el 3 de decembre de 2020.
  21. «Towards Principled Design of Deep Convolutional Networks: Introducing SimpNet» (en inglés). Github. Consultat el 3 de decembre de 2020.
  22. «Parallel Computing Center (Khmelnytskyi, Ukraine) represents an ensemble of 5 convolutional neural networks which performs on MNIST at 0.21 percent error rate.» (en inglés). Consultat el 24 de novembre de 2016.
  23. Research Bulletin of NTUU "Kyiv Polytechnic Institute".6
    29-34.doi:10.20535/1810-0546.2016.6.84115.
  24. «Classify MNIST digits using Convolutional Neural Networks» (en inglés). GitHub. Consultat el 3 d'agost de 2018.
  25. Proceedings of the 2018 International Conference on Information System and Data Mining.doi:10.1145/3206098.3206111.