Random forest
Random forest (o random forests) també coneguts en castellà com a Boscs aleatoris és una combinació d'arbres predictores tal que cada arbre depén dels valors d'un vector aleatori provat independentment i en la mateixa distribució per a cada u d'estos. És una modificació substancial de bagging que construïx una llarga colecció d'arbres no correlacionados i després els promedia.[1][2]
l'algoritme per a induir un random forest va ser desenrollat per Leo Breiman i Adele Cutler i Random forests és el seu marca de fàbrica. El terme apareix de la primera proposta de Random decision forests, feta per Tin Kam Ho de Bell Labs en 1995. El método combina l'idea de bagging de Breiman i la selecció aleatòria d'atributs, introduïda independentment per Ho, Amit i Geman, per a construir una colecció d'arbres de decisió en variació controlada.
La selecció d'un subconjunt aleatori d'atributs és un eixemple del método random subspace, el que, segons la formulació de Ho, és una manera de portar a terme la discriminació estocàstica[3] proposta per Eugenio Kleinberg.
En molts problemes el rendiment de l'algoritme random forest és molt similar a la del boosting, i és més simple d'entrenar i ajustar. Com a conseqüència, el Random forest és popular i àmpliament utilisat.
Definició de random forests
[editar | editar còdic]L'idea essencial del bagging és promediar molts models sorollosos pero aproximadament imparcials, i per tant reduir la variació. Els arbres són els candidats ideals per al bagging, ya que ells poden registrar estructures d'interacció complexa en les senyes, i si creixen suficientment profunt, tenen relativament baixa parcialitat. Producte de que els arbres són notòriament sorollosos, ells es beneficien enormement al promediar.
Cada arbre és construït usant el següent algoritme:
- Siga N el número de casos de prova, M és el número de variables en el classificador.
- Siga m el número de variables d'entrada a ser usat per a determinar la decisió en un nodo donat; m deu ser molt menor que M
- Elegir un conjunt d'entrenament per a este arbre i usar el restant dels casos de prova per a estimar l'error.
- Per a cada nodo de l'arbre, elegir aleatoriamente m variables en les quals basar la decisió. Calcular la millor partició del conjunt d'entrenament a partir de les m variables.
Per a la predicció un nou cas és espentat cap a avall per l'arbre. Després se li assigna l'etiqueta del nodo terminal a on termina. Este procés és iterado per tots els arbres en el ensamblado, i l'etiqueta que obtinga la major cantitat d'incidències és reportada com la predicció.
Característiques (o traces) i Ventages
[editar | editar còdic]Les ventages del random forests són:[4]
- Ser un dels algoritmes d'aprenentage més certers que hi ha disponible. Per a un conjunt de senyes lo suficientment gran produïx un classificador molt certer.
- Córrer eficientemente en bases de senyes grans.
- Manejar centenars de variables d'entrada sense excloure cap.
- Donar estimacions de quines variables són importants en la classificació.[1][2]
- Tindre un método eficaç per a estimar senyes perdudes i mantindre l'exactitut quan una gran proporció de les senyes està perduda.
- Computar els prototips que donen informació sobre la relació entre les variables i la classificació.
- Computar les proximitats entre els parells de casos que poden usar-se en els grups, localisant valors atípics, o (ascendint) donant vistes interessants de les senyes.
- Oferir un método experimental per a detectar les interaccions de les variables.
Vore també
[editar | editar còdic]Referències
[editar | editar còdic]- ↑ 1,0 1,1 Journal of Transportation Engineering, Part B: Pavements.146(2)
- 04020022.ISSN 2573-5438.doi:10.1061/JPEODX.0000175.Consultat el 7 d'agost de 2020.
- ↑ 2,0 2,1 Hastie, Trevor.; Friedman, J. H. (Jerome H.), {{{nom2}}} (2001). The elements of statistical learning : data mining, inference, and prediction : with 200 full-color illustrations, Springer. OCLC 46809224. ISBN 0-387-95284-5.
- ↑ (1996).Annals of Statistics.24(6)
- 2319–2349.doi:10.1214/aos/1032181157.
- ↑ [1]
Referències
[editar | editar còdic]
- Este artícul conté una traducció derivada de «Random forest» de Wikipedia en castellà publicada baix la Llicència de documentació lliure de GNU i la Llicència Creative Commons Reconeiximent-CompartirIgual 4.0 Internacional.