52 conjuntos de datos para proyectos de entrenamiento.

  1. Conjunto de Datos de Clientes de Mall — datos de visitantes de la tienda: id, género, edad, ingresos, clasificación de gastos. (Opción de aplicación: Proyecto de Segmentación de Clientes con Aprendizaje Automático)
  2. Conjunto de Datos Iris — conjunto de datos para principiantes, que contiene las dimensiones de los sépalos y pétalos de varias flores.
  3. Conjunto de Datos MNIST — conjunto de datos de cifras escritas a mano. 60,000 imágenes de entrenamiento y 10,000 imágenes de prueba.
  4. El Conjunto de Datos de Viviendas de Boston — conjunto de datos popular para el reconocimiento de patrones. Contiene información sobre viviendas en Boston: número de apartamentos, costo de alquiler, índice de criminalidad.
  5. Conjunto de Datos de Detección de Fake News — contiene 7796 registros etiquetados de noticias: verdad o mentira. (Opción de aplicación con código fuente en Python: Proyecto de Detección de Fake News en Python )
  6. Conjunto de datos sobre la calidad del vino — contiene información sobre el vino: 4898 registros con 14 parámetros.
  7. Datos SOCR – Conjunto de Datos de Alturas y Pesos — una buena opción para empezar. Contiene 25,000 registros sobre altura y peso de personas de 18 años.

    52 conjuntos de datos para proyectos de entrenamiento.

    Este artículo fue traducido con el apoyo de EDISON Software, que realiza pedidos desde el sur de China "con éxito", así como desarrolla aplicaciones web y sitios.

  8. Conjunto de Datos de Parkinson — 195 registros sobre pacientes con la enfermedad de Parkinson, con 25 parámetros de análisis. Puede ser utilizado para una evaluación preliminar de la diferenciación entre personas enfermas y sanas. (Opción de aplicación con código fuente en Python: Proyecto de Aprendizaje Automático sobre Detección de la Enfermedad de Parkinson)
  9. Conjunto de Datos del Titanic — contiene información sobre pasajeros (edad, género, familiares a bordo, etc.) 891 en el conjunto de entrenamiento y 418 en el de prueba.
  10. Conjunto de Datos de Recogidas de Uber — información sobre 4.5 millones de viajes de Uber en 2014 y 14 millones en 2015. (Opción de aplicación con código fuente en R: Proyecto de Análisis de Datos de Uber en R)
  11. Conjunto de Datos Chars74k — contiene imágenes de símbolos Británicos y Canadienses de 64 clases: 0-9, A-Z, a-z. 7700 imágenes naturales, 3400 escritas a mano, 62000 fuentes sintetizadas por computadora.
  12. Conjunto de Datos de Detección de Fraude con Tarjeta de Crédito — contiene información sobre transacciones de tarjetas de crédito comprometidas. (Opción de aplicación con código fuente: Proyecto de Detección de Fraude con Tarjeta de Crédito mediante Aprendizaje Automático)
  13. Conjunto de Datos de Intenciones de Chatbot — archivo JSON que contiene varias etiquetas: saludos, despedidas, búsqueda de hospital, búsqueda de farmacia, etc. Contiene un conjunto de plantillas de "pregunta-respuesta". (Opción de aplicación con código fuente en Python: Proyecto de Chatbot en Python)
  14. Conjunto de Datos de Correos Electrónicos de Enron — contiene medio millón de correos de 150 gerentes de Enron.
  15. El Conjunto de Datos de Yelp — contiene 1.2 millones de recomendaciones de 1.6 millones de usuarios sobre 1.2 millones de organizaciones.
  16. Conjunto de Datos de Jeopardy — más de 200,000 registros de "pregunta-respuesta" de un popular programa de televisión.
  17. Conjunto de Datos de Sistemas de Recomendación — portal con una colección de conjuntos de datos de la Universidad de UCSD. Contiene registros de reseñas en sitios populares (Goodreads, Amazon). Ideal para crear sistemas de recomendación. (Opción de aplicación con código fuente en R: Proyecto de sistema de recomendación de películas en R )
  18. Conjunto de datos UCI Spambase — conjunto de datos para entrenamiento en la detección de spam. Contiene 4601 correos electrónicos con 57 parámetros de metadatos.
  19. Conjunto de datos Flickr 30k — más de 30,000 imágenes y sus leyendas. (Conjunto de datos Flickr 8k — 8000 imágenes. Proyecto con código fuente en Python: Generador de leyendas de imágenes en Python)
  20. Reseñas IMDB — 25,000 reseñas de películas en el conjunto de entrenamiento y 25,000 en el de prueba. (Opción de aplicación con código fuente en R: Proyecto de análisis de sentimientos en ciencia de datos)
  21. Conjunto de datos MS COCO — 1.5 millones de imágenes etiquetadas.
  22. Conjuntos de datos CIFAR-10 y CIFAR-100 — CIFAR-10 contiene 60,000 pequeñas imágenes de 32*32 píxeles de los números 0-9. CIFAR-100, en consecuencia, de 0 a 100.
  23. Conjunto de datos GTSRB (benchmark de reconocimiento de señales de tráfico alemanas) — 50,000 imágenes de 43 señales de tráfico. (Opción de aplicación con código fuente en Python: Proyecto de reconocimiento de señales de tráfico en Python)
  24. Conjunto de datos ImageNet — contiene más de 100,000 frases y alrededor de 1000 imágenes por frase.
  25. Conjunto de datos de imágenes de histopatología de mama — el conjunto de datos contiene imágenes de muestras de cáncer de mama. (Aplicación con código fuente en Proyecto de clasificación de cáncer de mama en Python)
  26. Conjunto de datos Cityscapes — contiene anotaciones de alta calidad de secuencias de video de calles de diferentes ciudades.
  27. Conjunto de datos Kinetics — contiene enlaces URL a alrededor de 6.5 millones de videos de alta calidad.
  28. Conjunto de datos MPII de poses humanas — el conjunto de datos contiene 25,000 imágenes de poses humanas con anotaciones de articulaciones.
  29. Conjunto de datos 20BN-something-something v2 — conjunto de videos de alta calidad que muestran cómo una persona realiza diversas acciones.
  30. Conjunto de datos Object 365 — conjunto de datos de imágenes de alta calidad con cuadros delimitadores de objetos.
  31. Conjunto de datos de esbozos fotográficos — contiene más de 1000 imágenes con sus dibujos de contornos.
  32. Conjunto de datos CQ500 — el conjunto de datos contiene 491 escaneos de cabeza por TC con 193,317 cortes.
  33. Conjunto de datos IMDB-Wiki — conjunto de datos con más de 5 millones de imágenes faciales etiquetadas por género y edad. (Aplicación con código fuente en Proyecto de detección de género y edad en Python)
  34. Conjunto de datos Youtube 8M — conjunto de datos de videos etiquetados que contiene 6.1 millones de identificadores de videos de Youtube.
  35. Conjunto de datos Urban Sound 8K — conjunto de datos de sonidos urbanos (contiene 8732 sonidos urbanos de 10 clases).
  36. Conjunto de datos LSUN — conjunto de datos compuesto de millones de imágenes a color de escenas y objetos (alrededor de 59 millones de imágenes, 10 categorías de escenas distintas y 20 categorías de objetos distintas).
  37. Conjunto de datos RAVDESS — base de datos audiovisual de habla emocional. (Aplicación con código fuente en Proyecto de reconocimiento de emociones en el habla en Python)
  38. Conjunto de datos Librispeech — el conjunto de datos contiene 1000 horas de habla en inglés con diferentes acentos.
  39. Baidu Apolloscape Dataset — conjunto de datos para el desarrollo de tecnologías de conducción autónoma.
  40. Quandl Data Portal — almacén de datos económicos y financieros (hay contenido gratuito y de pago).
  41. El portal de datos abiertos del Banco Mundial — información sobre los préstamos otorgados por el Banco Mundial a países en desarrollo.
  42. IMF Data Portal — portal del Fondo Monetario Internacional que publica datos sobre finanzas internacionales, tasas de deuda, inversiones, reservas de divisas y mercancías.
  43. American Economic Association (AEA) Data Portal — recurso para buscar datos macroeconómicos de EE. UU.
  44. Google Trends Data Portal — los datos de tendencias de Google se pueden utilizar para explorar y analizar datos visualmente.
  45. Financial Times Market Data Portal — recurso para obtener información actualizada sobre los mercados financieros de todo el mundo.
  46. Data.gov Portal — portal de datos abiertos del gobierno de EE. UU. (agricultura, salud, clima, educación, energía, finanzas, ciencia y investigación, etc.).
  47. Data Portal: Open government data (India) — plataforma de datos abiertos del gobierno de India.
  48. Food environment Atlas Data Portal — contiene datos de investigaciones sobre nutrición en EE. UU.
  49. Health Data Portal — este es el portal del Departamento de Salud y Servicios Humanos de EE. UU.
  50. Centers for Disease Control and Prevention Data Portal — contiene una amplia gama de datos relacionados con la salud.
  51. London Datastore Portal — datos sobre la vida de las personas en Londres.
  52. Canada Government Open Data Portal — portal de datos abiertos sobre los canadienses (agricultura, arte, música, educación, gobierno, salud, etc.)

Leer más

Fuente: habr.com

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster