Ir al contenido

Comprender los errores de identificación en Pl@ntNet

En 2026, Pl@ntNet reconoce aproximadamente 85.000 especies. En ciertos casos, un error de identificación puede reforzarse con el tiempo: una especie común se confunde regularmente con una especie rara que se le parece, y estas nuevas observaciones contribuyen luego a mantener la confusión.

Desde hace varios años, miembros experimentados de la comunidad, llamados los vigilantes (veilleurs), detectan y documentan estas situaciones.

El cruce de su trabajo con un análisis estadístico nos permite comprender mejor el fenómeno y dar un primer orden de magnitud: aproximadamente 1.500 especies podrían estar afectadas, de las cerca de 85.000 especies reconocidas por Pl@ntNet. Esta estimación sigue siendo incierta y depende de varias hipótesis.

El sistema de identificación de Pl@ntNet se apoya principalmente en las observaciones validadas por la comunidad. Cuanto más numerosos y correctamente identificados sean los datos disponibles, más pueden contribuir a mejorar el modelo.

Pero cuando se instala una confusión entre dos especies cercanas, este mecanismo también puede amplificar un error.

Tomemos una especie común, representada por miles de observaciones, y una especie rara que se le parece. Si el modelo comienza a proponer con demasiada frecuencia la especie rara en lugar de la especie común:

  1. algunas observaciones de la especie común se registran bajo el nombre de la especie rara;

  2. estas observaciones aumentan la cantidad de datos asociados a la especie rara;

  3. el modelo aprende progresivamente esta confusión y puede proponer la especie rara aún más a menudo.

Como las especies raras generalmente disponen de menos observaciones, una cantidad relativamente pequeña de datos erróneos puede tener un efecto importante en su representación.

Los vigilantes hablan entonces de deriva de identificación: un error que no permanece aislado, sino que puede alimentarse a sí mismo.

Los vigilantes son usuarios experimentados (botánicos confirmados o aficionados muy avanzados) que detectan las derivas y participan en su corrección gracias al sistema de validación colaborativa.

A lo largo de los años, su trabajo ha permitido constituir un catálogo de casos documentados: especies que se confunden, evolución del problema y correcciones realizadas. Aproximadamente 190 especies han sido estudiadas en detalle.

Esta experiencia es particularmente importante porque una evolución estadística inusual no basta, por sí sola, para probar que existe una deriva. La interpretación de los datos requiere conocer las especies y su contexto.

Los vigilantes utilizan varios términos para describir los diferentes casos encontrados.

Una source (fuente) es generalmente una especie común que comienza a ser reconocida correctamente con menos frecuencia. Sus observaciones se atribuyen progresivamente a otra especie.

Un sink (sumidero) es la especie que recibe estas observaciones de manera incorrecta. A menudo se trata de una especie rara, cuya base de observaciones puede verse rápidamente afectada por estos errores.

Un underdog es también una especie rara y sub-reconocida, pero sin que necesariamente haya una deriva de por medio. Simplemente puede carecer de observaciones o ser difícil de identificar.

Los vigilantes suelen priorizar un enfoque llamado curación asimétrica: limpian prioritariamente los datos del sink. Corregir una base pequeña fuertemente contaminada puede ser más eficaz que corregir directamente una gran base de observaciones.

Un análisis independiente estudió 795 especies que disponen de más de 500 observaciones, lo que representa aproximadamente 2,5 millones de observaciones entre 2017 y 2024.

Para cada especie, el análisis estima si su probabilidad de ser detectada por los usuarios aumenta o disminuye con el tiempo. Esta evolución se representa mediante una pendiente:

  • una pendiente negativa indica que la especie es cada vez menos detectada;

  • una pendiente positiva indica que es cada vez más detectada.

La hipótesis es que una source debería presentar más bien una pendiente negativa, mientras que un sink podría presentar una pendiente positiva.

El cruce con los casos ya conocidos por los vigilantes da un resultado contrastado.

Para las sources, las pendientes negativas parecen ser una buena herramienta de detección: aproximadamente el 80% de las sources conocidas aparecen en esta lista, con una pureza estimada de alrededor del 74%.

Para los sinks, el resultado es mucho menos útil. Solo se encuentra aproximadamente el 13% de los sinks conocidos. La razón principal es que los sinks suelen ser raros y disponen de menos de 500 observaciones: por lo tanto, quedan excluidos del análisis desde el principio.

Las pendientes pueden, por tanto, ayudar a priorizar las especies a examinar, pero no reemplazan la experiencia de los vigilantes.

Por qué las correcciones a veces complican el análisis

Sección titulada «Por qué las correcciones a veces complican el análisis»

La propia curación puede modificar las estadísticas utilizadas para detectar las derivas.

Cuando se limpia un sink, una parte de las observaciones retiradas a menudo se revalida como perteneciente a la source. La source gana entonces observaciones, mientras que el sink las pierde.

Con el tiempo, esto puede modificar sus respectivas pendientes:

  • una source ya corregida puede dejar de aparecer como una especie en declive;

  • un sink limpiado puede, por el contrario, aparecer entre las especies con una pendiente negativa.

Por lo tanto, es importante conservar el historial de las correcciones. Una especie ya identificada como source puede seguir siendo vulnerable a nuevas derivas, incluso después de haber sido corregida.

¿Cuál podría ser la magnitud del fenómeno?

Sección titulada «¿Cuál podría ser la magnitud del fenómeno?»

Combinando los casos documentados por los vigilantes y los resultados del análisis estadístico, se obtienen las siguientes estimaciones:

  • aproximadamente 450 sources;

  • aproximadamente 1.000 sinks, con una estimación más incierta de entre 600 y 1.300 según el método;

  • aproximadamente 1.500 especies afectadas en total por una deriva de identificación.

A modo de comparación, Pl@ntNet reconoce unas 85.000 especies.

Estas cifras deben interpretarse con cautela. El catálogo de los vigilantes no es una muestra aleatoria y se centra principalmente en la flora europea. El análisis estadístico solo cubre las especies con al menos 500 observaciones y se basa en un periodo que va de 2017 a 2024.

Estos resultados dan, por tanto, un orden de magnitud y no una medida definitiva del fenómeno.

¿Puede una especie ser una source en una región y un sink en otra? ¿Se puede identificar el momento preciso en que comienza una deriva? ¿Es posible encontrar los sinks a partir de las sources ya conocidas?

A largo plazo, el objetivo podría ser desarrollar herramientas capaces de señalar automáticamente las especies que comienzan a derivar. Estas herramientas no reemplazarían la experiencia humana, sino que podrían ayudar a los vigilantes a detectar los problemas antes.

Las derivas de identificación son un fenómeno real que afecta a una parte limitada de las especies reconocidas por Pl@ntNet.

El trabajo de los vigilantes es esencial para detectarlas, comprenderlas y corregirlas. El análisis estadístico aporta, por su parte, un medio adicional para identificar las especies que merecen una atención especial.

Al combinar la experiencia botánica y el análisis de datos, Pl@ntNet dispone de una mejor base para seguir estas derivas e intervenir antes de que se vuelvan más importantes.