División de Datos. 2013. Retrospectiva

En 2013 IBS, que en ese momento parecían crear División de Datos, me pidieron que hiciera un brain dump (exclusivamente basado en la experiencia con clientes corporativos en la industria de petróleo y gas) sobre el área problemática de Big Data y los datos en general. Aquí me encontré con ello después de 7 años y me pareció curioso. Algunas cosas son obvias. Algunas resultaron no ser del todo correctas, pero... han pasado 7 años.

Escribí en inglés y pensé en traducir al español. ¿Quizás algo sigue siendo relevante hoy en día? (Traduciré los bullet points, y dejaré las tablas en inglés por pereza. Verde - bueno, rojo - peligroso, azul - sueño).

Haré mínimos comentarios de «hoy» en cursiva, para que sea comprensible y diferenciable.

Entonces, ¡DATOS! Necesitamos datos...

La División de Datos es como la División de Sangre, porque los datos se pueden comparar, por ejemplo, con la sangre que corre por las venas y arterias del organismo empresarial. Sin embargo, aunque la sangre es una, los organismos son diferentes y por eso la productización es muy complicada, pero también representa una oportunidad para el desarrollo.

Hay personas que ven los datos de inmediato; son Nosotros.
Y hay personas que lamentablemente no ven los datos en absoluto. Estos, lamentablemente, son nuestros Clientes!

División de Datos. 2013. Retrospectiva

Así que, los postulados del negocio...

  1. Vendemos al negocio, y no TI (que me perdonen todos los técnicos de IT de inmediato) ya que resolvemos problemas mundiales, y además, generar más ingresos.
  2. Todos los problemas empresariales se concentran en verticales industriales temáticas y requerirán una adecuada especialización.
  3. Intentar demostrar el valor de los «datos» o, lo que es aún más complicado, el valor de «la gestión de datos» para el negocio, es un eterno sufrimiento y dolor. En esencia, es como acercarse a una persona que se siente bien y decirle: “Amigo, vamos a tratar tu sangre, y amigo, ¡eso será caro!”
  4. Mi verdadero «sueño húmedo» es vender «extracción de datos» y «análisis» a pequeñas y medianas empresas, que se han metido en 123 servicios en la nube con interfaces interesantes: gestión de proyectos, atención al cliente, contabilidad, CRM, nómina, informes de tiempo, marketing, ... tú ponle el nombre, y se han hundido en los datos. Youcalc y SuccessFactors (probablemente ya no existan) eso es bueno!
  5. Busca personas que disfruten trabajar “crunch” con los datos. Son raras y extrañas (como los adivinos de los posos de café), pero clave para el negocio. Un poeta, por ejemplo, puede entender muy bien la correlación.
  6. Ingenieros ¡Necesarios! Necesarios para transformar los problemas que los Crunchers extraen de los datos en soluciones. Y el éxito o el fracaso de estas soluciones depende completamente de ellos.
  7. Desarrollo código abierto Los proyectos representan un gran valor y permiten "construir" soluciones complejas prácticamente desde " cero".
  8. Pero… no se debe olvidar que Hadoop es una biblioteca, y Lucene también es una biblioteca, y la distancia entre una biblioteca y un producto industrial ¡es significativa!
  9. Las soluciones construidas tendrán que adaptarse considerablemente, porque la modularidad y la integrabilidad son puntos clave.
  10. Agile (perdóname Dios) es una técnica clave en la interacción con el cliente y la verificación de hipótesis, de las cuales habrá muchas.
  11. Externalizar todo el código y el UI es especialmente posible y necesario. Todo el análisis de negocio y las especificaciones del backend deben ser dejados dentro y considerados como una competencia clave.
  12. Las personas que toman decisiones empresariales deben estar constantemente "informadas" sobre la necesidad de manejar correctamente los datos y la búsqueda constante de nuevas formas de analizarlos. La combinación de competencias técnicas y empresariales de nuestros empleados ayudará a elevar el estatus de toda la organización en su conjunto.
  13. Internet es una fuente inagotable de inspiración (en aquel entonces aún no había tantos gatitos) en cuanto a enfoques para la gestión corporativa de datos, a pesar de que las tareas y la escala varían significativamente.

División de Datos. 2013. Retrospectiva

Los postulados tecnológicos…

  1. Hay un enorme potencial de desarrollo en la simplificación de cómo los datos se muestran a las personas. Se puede llamar eso "iPhoneización".
  2. A pesar de que los proveedores de BI afirman que traen directamente la analítica a los usuarios finales, (y ciertamente están avanzando en esa dirección) – la ruptura aún no ha ocurrido. Las personas simplemente entienden mal los datos multidimensionales.Una interfaz de usuario que presenta datos poco estructurados más o menos complejos en un formato facetado también presenta una cantidad infinita de problemas. Conclusión: cuanto más plana (flatter) – mejor.
  3. Una plataforma construida sobre la extracción automática de datos de fuentes (que no siempre están destinadas para tal extracción) está en una dependencia significativa de las fuentes, la estabilidad de los conectores y la infraestructura. En la incapacidad de proporcionar resultados, siempre se culpará a la plataforma (al mensajero). facetizado en forma - presenta también una cantidad infinita de problemas. Conclusión: cuanto más plano (flatter) - mejor.
  4. La plataforma, construida sobre la base de la extracción automática de datos de fuentes (que no siempre están destinadas para tal extracción), depende en gran medida de las fuentes, la estabilidad de los conectores y la infraestructura. En la incapacidad de proporcionar resultados, siempre se culpará a la plataforma (el mensajero). Confianza – capital de este tipo de plataformas. Capital que es difícil de ganar y fácil de perder.
  5. Desde un punto de vista empresarial, no hay diferencia entre el análisis de Big Data y Simplemente Datos. A menudo, tras cifras tan simples como 2x2, se esconden oportunidades por millones de dólares. Un buen ejemplo son los datos sobre la finalización de la vida útil de los elementos de infraestructura en la plataforma continental noruega. Cuando todas las fechas de futuras reparaciones de capital de todo el equipo se colocaron en un mismo eje y se descubrió que, en N años, se avecina un verdadero Armagedón en la plataforma — un hombre muy rico se levantó de su silla, se despidió rápidamente y salió de la habitación con las palabras: "Disculpe, no tengo mucho tiempo, tengo que preparar la flota..."
  6. Excel, y en esencia una representación tabular clara y concisa de los datos posee un gran poder y un futuro brillante. Creo en las tablas atractivas (y todavía) ¡y eso es todo!
  7. El lazo principal de toda esta "analítica" es la automatización de la toma de decisiones. Ahí están las oportunidades más jugosas, pero también los riesgos más altos, por eso las oportunidades son jugosas, por eso los riesgos son altos, por eso las oportunidades, por eso los riesgos... 🙂 La gestión de la perforación de pozos, por ejemplo...
  8. Si la "integrabilidad" es una característica clave, los datos de facto deben ser presentados como un servicio. REST es excelente, pero no hay que olvidar la optimización rendimiento, que a menudo se sacrifica en favor de la integrabilidad, ya que la potencia de cálculo sigue aumentando.
  9. Los datos maestros son lo que se necesita localizar, extraer, estandarizar antes de abordar cualquier cuestión empresarial. Los datos maestros son pequeños, ¡y los problemas con ellos son grandes! Como dicen los hermanos semánticos: el 50% de todos los problemas mundiales proviene de que las personas llaman a las mismas cosas con diferentes nombres, y el otro 50% proviene de que llaman diferentes cosas con el mismo nombre.
  10. Cualquiera la encapsulación a nivel de almacenamiento limita la apertura de la solución y lleva a la SILO-ificación. Está bien si eres un gran proveedor, de lo contrario — no tanto. (Aquí estamos hablando, por supuesto, no del nivel de bloques ni de AWS S3, que ya tenía 6 años por entonces, sino de archivos).
  11. La modelación relacional de datos ya no es nuestra amiga. ¡RDF y key-value son geniales! Hemos visto transformaciones mágicas de bases de datos relacionales de modelos con 2000 tablas a 15 tablas, y ninguno de los usuarios ha perdido nada.
  12. Internet funciona porque hay URL como un único medio de direccionamiento. La importancia de la URL o más bien URI para los recursos informativos de la empresa es difícil de sobrestimar.
  13. Text mining y NLP son populares. En Internet. Pero también en el sector corporativo se pueden alcanzar enormes éxitos extrayendo datos estructurados de datos no estructurados corporativos.
  14. Sinergia entre datos estructurados e información extraída de datos no estructurados, es decir, archivos: el Klondike analítico.
  15. Al extraer datos, no debemos olvidar los derechos y los derechos de autor.
  16. Una empresa que se dedica a la extracción de datos debe formar undepartamento de hackers, en el buen sentido de la palabra. Inspirado en la dura lucha contra los sistemas de protección de las Páginas Amarillas por parte de los bots de búsqueda.
  17. Antes de trabajar con los datos, es necesario «verlos» en su totalidad. Es difícil de explicar. Me vienen a la mente formularios tabulares. A algunos les pueden resultar representaciones gráficas, pero cualquier gráfico es ya una interpretación. De una forma u otra… ¡«ver»!
  18. Reiterándose en la cuestión de la «confianza» de los usuarios en el front-end. Confianza en los conectores/procesos de generación de datos, confianza en los datos, confianza en las decisiones tomadas.

Fuente: habr.com

Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS 🔥 Compra un hosting fiable para sitios web con protección contra DDoS, servidores VPS VDS | ProHoster