OBT IA Crawler Producto · v2.2

Ordena y clasifica todo tu tenant con IA

Barrido masivo, clasificación con IA y análisis de riesgo de todo el contenido de Microsoft 365 — SharePoint, OneDrive, Teams, file servers y correo. Metadatos de negocio y sensibilidad escritos donde importan. Sin licencias E5 ni Copilot.

Informe inicial sin compromiso de migración · Solo lectura: nada se escribe sin tu aprobación · Opción in-tenant para regulados
Parte de OBT Intelligence Suite

OBT IA Crawler recorre todo el contenido de un tenant de Microsoft 365 —SharePoint, OneDrive, Teams, servidores de ficheros y correo exportado—, lo clasifica con IA y devuelve un mapa de inventario, duplicados y riesgo de datos personales. La clasificación lleva humano en el bucle: nada se escribe en el tenant sin aprobación previa.

Para quién
Organizaciones que necesitan saber qué contenido tienen y dónde está el riesgo antes de migrar, sanear o aplicar gobierno documental.
Qué entrega
Informe inicial con inventario, contenido obsoleto y duplicado, y mapa de riesgo de datos personales. Después, saneamiento reversible y migración con metadatos.
Limitaciones
La clasificación propone, no decide: requiere aprobación humana antes de escribir nada. El informe inicial es de solo lectura sobre el tenant.
Desde
990 € el informe inicial. Sin licencias E5 ni Purview.
Fuentes de datos

Un solo motor para todo tu contenido

El riesgo no vive solo en SharePoint: los OneDrive personales, los canales de Teams y el correo exportado son donde se acumula la PII sin gobernar. El IA Crawler los barre todos y los lleva al mismo informe, el mismo mapa de riesgo y la misma propuesta de taxonomía.

SharePoint Online

SharePoint Online

Bibliotecas de todos los sitios, con barrido incremental (delta de Microsoft Graph): tras el barrido inicial, solo se procesa lo que cambia.

Requiere: permisos de lectura Graph (Sites.Read.All)
☁️

OneDrive

Nuevo

El OneDrive de todos los usuarios del tenant (o un subconjunto filtrado), con enumeración automática de unidades. El mapa de riesgo señala carpeta y propietario.

Requiere: User.Read.All + Files.Read.All (aplicación)
Microsoft Teams

Microsoft Teams

Nuevo

Los ficheros de todos los equipos y sus canales. Los equipos sin biblioteca se omiten sin romper el barrido.

Requiere: Group.Read.All + Files.Read.All (aplicación)
🗄️

File server

Árbol completo de carpetas (NTFS/SMB) con escáner local reanudable. Ideal como inventario previo a una migración a SharePoint Online.

Requiere: acceso de lectura al recurso compartido
✉️

Correo exportado

Nuevo

Ficheros .eml (MIME completo: cabeceras, multipart, adjuntos) y .msg de Outlook encontrados en cualquiera de las otras fuentes. Nóminas, datos de pacientes y contratos que viajan como adjuntos se clasifican y puntúan como cualquier documento.

Automático — el extractor los procesa como un documento más
🏢

SharePoint on-premise (2016 · 2019 · SE)

Inventario completo del farm para migraciones: content types y su uso, columnas, term store, topología y permisos. Consolidación de CTs duplicados (p. ej. 47 CTs → 8 unificados).

Requiere: cuenta de lectura del farm
Fin de soporte de SharePoint 2016/2019 (14-jul-2026): sin actualizaciones de seguridad ni parches. El IA Crawler barre el farm en solo lectura y entrega el assessment de migración —inventario, content types, permisos y exposición de PII— con la arquitectura de destino propuesta; después ejecuta la migración clasificada a SharePoint Online o Subscription Edition.
Dos análisis complementarios

Primero sin IA. La IA, donde de verdad aporta

El informe se produce con dos motores sobre el mismo barrido, entregados juntos. El análisis base es determinista y corre sobre el 100% del origen sin coste de IA; la capa de IA se aplica documento a documento sobre lo que las reglas no resuelven. No eliges «reglas o IA»: recibes ambos.

1 · Análisis base — sin IA

Determinista y reproducible, sobre el 100% del origen: inventario completo, duplicados exactos por hash, ROT cuantificado, PII validada por checksum (DNI/NIE, IBAN mod-97, tarjeta Luhn), tipo de documento aproximado por reglas, arquitectura propuesta y mapa de riesgo. Sin coste de IA. Lo que no hace: leer escaneados ni deducir cliente/proyecto.

2 · Capa de IA — clasificación fina (LLM + OCR)

Documento a documento, donde el análisis base no llega: extracción real de metadatos (tipo fino, cliente, proyecto, área, fecha, sensibilidad), PII con precisión —entiende el contexto y reduce falsos positivos—, lectura de escaneados e imágenes con OCR y confianza por documento. El triaje reserva el LLM solo para lo ambiguo o sensible.

Cómo funciona

De caos documental a tenant preparado para IA, en 5 fases

Empiezas por un informe de bajo coste y sin compromiso. Cada fase es opcional y se apoya en la anterior — y hasta que apruebas, el IA Crawler trabaja en modo solo lectura: no escribe ni mueve nada.

1

Informe inicial (AI Crawling)Solo lectura

Inventario completo del origen: volumen y tipos de contenido, duplicados, ROT (contenido redundante, obsoleto y trivial), PII y mapa de riesgo por carpeta y propietario, propuesta de taxonomía y proyección de crecimiento a 3 años. Entregable profesional de 20-30 páginas, bajo coste, sin compromiso de migración.

2

Assessment de datos confidenciales + saneamientoTú decides

El barrido se convierte en un assessment accionable: informe de exposición (qué PII hay y dónde, con validadores por checksum y diccionarios RGPD art. 9) y propuesta de saneamiento. El ROT se agrupa en lotes revisables y tú decides por grupo: excluir, archivar, conservar o revisar. Nunca se borra nada — cuarentena reversible con auditoría completa.

3

Metadatos + triaje, y migración clasificada

Preparación de la extracción de metadatos: la cola de triaje confirma o corrige lo dudoso y deriva la arquitectura destino (content types, columnas, listas y bibliotecas), que se aprovisiona antes de migrar. Migración con la herramienta que prefieras (SPMT, ShareGate…) y escritura post-migración de los metadatos de negocio y sensibilidad vía Graph: cada documento aterriza ya etiquetado.

4

Búsqueda con IAAdd-on

Búsqueda facetada + lenguaje natural sobre los metadatos generados: «contratos de Pierre Fabre de 2025 confidenciales» se convierte en filtros estructurados en segundos. Con security trimming nativo de SharePoint — cada usuario solo ve lo que ya podía ver.

5

Gobierno continuo

Clasificación continua de documentos nuevos y visibilidad permanente: qué hay, dónde está, qué es sensible y quién accede. Los mismos metadatos alimentan el buscador, el chatbot y los informes de gobierno de la OBT Intelligence Suite.

Arquitectura

Serverless sobre Azure, con la IA como pieza — no como caja negra

Sistema basado en eventos: el contenido entra por barrido masivo o en tiempo real, se extrae el texto (con OCR para escaneos), se clasifica con un pipeline LLM de coste escalonado y los metadatos se escriben de vuelta. Todo en región UE.

Origen
SharePoint · OneDrive · TeamsDelta de Graph, incremental
File server · Correo · SP on-prem
Ingesta
Azure FunctionsBarrido reanudable e idempotente
Service BusCola, reintentos, dead-letter
Procesado
Extracción de texto + OCROffice, PDF, escaneos, .eml/.msg
Clasificación LLM escalonadaModelo barato 1ª pasada → escalado si baja confianza · detección PII
Persistencia
Columnas de SharePointMetadatos de negocio + sensibilidad
Revisión humanaCola para baja confianza
Consumo
Búsqueda facetada + NLSecurity trimming nativo
Chatbot RAG · Informes de gobiernoOBT Intelligence Suite
🔒 Dos modelos de despliegue: SaaS multi-tenant en el Azure de OBTechnologies, o in-tenant — desplegado íntegramente en tu suscripción de Azure, de serie para farma y sectores regulados: tus datos y el cómputo no salen de tu entorno. Procesamiento en regiones UE y coste por documento monitorizado en telemetría.
Construido sobre: Microsoft Azure SharePoint Microsoft Teams TypeScript
Residencia de datos

Tú eliges dónde se procesan tus datos

La capa de IA (LLM) y el OCR se asignan según la residencia contratada — no tienes que elegir proveedores ni gestionar claves. Solo la opción in-tenant garantiza que los documentos no salen de tu entorno; si no, eliges entre Europa o worldwide.

🔒

Tu tenant (in-tenant)

Máxima garantía

El backend completo (motor, OCR self-host y Key Vault) se despliega en tu suscripción de Azure, en región UE. Es la única opción en la que los documentos no salen nunca de tu entorno. De serie en el tier Enterprise: farma/GxP, sanidad, banca.

IA: Azure OpenAI en tu tenant · OCR self-host (no almacena la imagen)
🇪🇺

Europa (UE)

Por defecto

Proveedores con residencia europea: Mistral (París, Francia) o Azure OpenAI en West Europe, en el Azure de OBTechnologies. Los documentos salen del tenant para procesarse, pero no salen de la Unión Europea. Idóneo para RGPD y sector regulado sin infraestructura propia.

IA: Mistral (UE) o Azure OpenAI West Europe · compromiso de no-entrenamiento
🌍

Worldwide (global)

APIs globales (OpenAI, Claude) para quien prioriza la máxima calidad de clasificación en casos ambiguos. Procesamiento en EE. UU., sin garantía de residencia europea — solo si tu política de datos lo permite.

IA: Claude (Anthropic) u OpenAI · a petición expresa del cliente
🔑 ¿Qué necesitamos para conectarnos a tu tenant? Para leer SharePoint / OneDrive / Teams (informe, solo lectura): un App Registration en tu Entra ID con permisos de aplicación Sites.Read.All y Files.Read.All (consentimiento de administrador), y estos datos: Tenant ID · Client ID · Client Secret o certificado · URL del sitio. Para la opción in-tenant, además: una suscripción de Azure y un grupo de recursos donde desplegar el backend (Function App, Key Vault y OCR self-host) — las claves viven en tu Key Vault y solo las recupera la Function App con su identidad administrada. Para file servers locales: una VM o equipo con acceso de lectura a las carpetas.
Resultados

Qué recibes exactamente

Entregables concretos desde la primera fase — no promesas. Más del 80% de los documentos se clasifican con confianza alta sin intervención humana; el resto pasa por la cola de revisión.

📊

Informe ejecutivo profesional

PDF de 20-30 páginas con KPIs de portada, gráficos vectoriales, 13+ secciones y roadmap — más un Excel con el detalle completo para tu equipo técnico.

🚨

Mapa de riesgo PII

Puntuación 0-100 por carpeta que pondera gravedad del dato (salud, tarjeta, DNI, IBAN…), antigüedad y sobreexposición. Señala carpeta y propietario: sabes exactamente dónde actuar primero.

🏷️

Propuesta de taxonomía

La IA propone los term sets de tipo, cliente, proyecto y área a partir de tu propio contenido — normalizando variantes («Contrato», «Contratos», «CT_Contrato_v2» → un término canónico con sinónimos).

🧹

Plan de saneamiento aprobable

ROT agrupado en lotes con impacto calculado en vivo: cuántos GB dejas de migrar y cuánto ahorras. Ejecución reversible, con dry-run y log de auditoría completo.

📁

Metadatos escritos en SharePoint

Tipo de documento, proyecto, cliente, área, fecha, idioma, sensibilidad y PII — escritos como columnas en el destino tras tu aprobación. Son la base del buscador, del RAG y del gobierno.

💊

Compliance pack por vertical

Para farma/GxP: tipos documentales del sector (PNT/SOP, batch records, CoA, CAPA…), detección de datos de salud (GDPR art. 9) y sensibilidad mínima por tipo. Extensible a legal y financiero.

Por qué nosotros

4 diferenciadores clave

Sin E5, sin Copilot

La clasificación automática nativa de Microsoft vive en Purview y exige E5. El IA Crawler clasifica negocio y sensibilidad en E3 o Business Premium — a una fracción del coste.

Un barrido alimenta todo

Los metadatos son la moneda común: el mismo barrido alimenta el informe, el buscador, el chatbot RAG y el gobierno. Pagas la inteligencia una vez.

In-tenant para datos sensibles

Despliegue íntegro en tu Azure: los datos no salen de tu entorno. Clave en farma, sanidad y regulados — y compatible con tus compromisos de residencia UE.

Humano en el bucle

La IA sugiere; lo dudoso lo confirma una persona. Nunca hay acciones destructivas automáticas: nada se borra, todo es reversible y auditado.

Precios

Empieza por el informe inicial

Precio fijo + variable por volumen, sin sorpresas. La clasificación continua y la migración se presupuestan a partir del informe — con datos reales de tu tenant, no estimaciones.

Básico

Una fuente: file server o una colección de SharePoint
990€ fijo
+ 120€/TB · hasta 10 TB
  • Inventario completo y detección de ROT
  • Clasificación IA de una muestra representativa
  • Informe ejecutivo PDF + Excel
Solicitar

Enterprise

Farma, sanidad, financiero y sectores regulados
2.900€ fijo
+ 70€/TB · sin límite de volumen
  • Todo lo de Premium
  • Ejecución in-tenant: tus datos no salen de tu Azure
  • Compliance pack del vertical (GxP, GDPR art. 9)
  • Workshop de resultados con tu equipo
Solicitar
💡 Regla de conversión: si contratas clasificación + migración en los 90 días siguientes, te descontamos el 50% del informe. Ejemplos: 2 TB Básico = 1.230 € · 15 TB Premium = 3.250 € · 25 TB Enterprise = 4.650 €. Precios sin IVA · julio 2026 · lanzamiento 2026-27 (−20% vs comparable de mercado).

Después del informe: precios v2 con datos reales

Con el número real de documentos y TB en la mano, el resto se cotiza sin estimaciones. Precio por documento — no por página ni por usuario licenciado. Comparable: Syntex custom ≈ 280 €/1.000 docs.

Clasificación como servicio

Por 1.000 documentos, con taxonomía de negocio incluida:
< 25k docs · 56–64 € (suelo 1.200 €)
25k–100k · 44–52 € (suelo 2.400 €)
100k–300k · 36–44 € (suelo 3.200 €)
> 300k · 28–36 € (a medida)

Clasificación continua (contenido nuevo): overage de 20–24 €/1.000 docs sobre la suscripción de gobierno.

Saneamiento y migración

Saneamiento ROT · desde 1.600 € + 32 €/TB
Remediación de permisos · desde 2.000 €
Consolidación de content types · desde 2.000 €
Paquete completo · desde 4.800 €

Migración: 800 €/TB hasta 5 TB · 640 €/TB 5–20 TB · 480 €/TB >20 TB (suelo 2.400 €; in-tenant +2.400 € de setup dedicado).

Búsqueda y gobierno recurrente

Búsqueda con IA: setup desde 2.000 € + suscripción 1.200 / 2.990 / 6.900 €/año (hasta 250 / 1.000 / 5.000 usuarios).
CoE — Gobierno continuo: 1.200 / 2.990 / 6.900 €/año.
Mapa de riesgo PII trimestral: 490 €/trimestre (incluido en CoE banda ≥ 2).
Compliance pack vertical: 900 € one-time.

Bundles: pack AI-Ready −15% · suite recurrente −20% · partners homologados −20/30%.

Documentación

Llévate la hoja de producto

Toda la información de esta página, lista para compartir con tu equipo o tu departamento de compras.

PDF
Hoja de producto v2.2 (Español) OBT-IACrawler-Hoja-Producto-ES.pdf
PDF
Product sheet v2.2 (Inglés) OBT-IACrawler-Product-Sheet-EN.pdf

¿Cuánto riesgo duerme en tu tenant?

Empieza por el informe inicial: bajo coste, sin compromiso de migración y en modo solo lectura. En unos días sabrás qué tienes, qué sobra y dónde está el riesgo.

Solicitar informe inicial Ver toda la suite