Un archivo donde se puede encontrar cualquier actuación
Digercules ordena archivos que crecen más rápido de lo que nadie tiene tiempo de ver — grabaciones, fotos, ficheros que nadie ha tenido tiempo de organizar. Si un local programa conciertos con regularidad, así suele ser su material.
La mayoría de los locales con los que aún no hemos trabajado ya tienen acumulado un fondo de grabaciones antiguas en algún sitio — unos discos, una carpeta en la nube, ficheros con nombres como IMG_4021.MOV. Cada nuevo concierto añade más: audio directo de la mesa de sonido, vídeo de quien tuviera la cámara sacada entre el público, fotos de la puerta. Encontrar una actuación concreta significa que alguien tiene que recordar qué noche fue y repasar horas de material a mano.
Nosotros ordenamos lo que ya se ha acumulado, y después mantenemos el archivo de forma que nadie tenga que ser quien se acuerde.
Cómo funciona
El primer pase recorre todo lo que ya existe — discos, carpetas, almacenamiento en la nube — y lo ordena por completo: qué hay dónde, qué duplica a qué, a qué noche pertenece cada fichero. Es un pase único por todo el fondo acumulado, y responde a la pregunta principal: qué hay realmente en ese montón de ficheros.
Después, el programa vuelve a la misma carpeta cada noche y comprueba qué hay nuevo desde ayer. Solo se procesa la diferencia — lo que ya está ordenado no se vuelve a tocar. Un archivo ordenado una vez no vuelve a convertirse en un montón sin etiquetar al cabo de un mes: se mantiene al día por sí mismo.
Qué ocurre cada noche
- Se escanea el almacenamiento — se comprueba contra la tabla de índice, solo los ficheros nuevos pasan a procesarse.
- El audio — de la mesa o extraído del vídeo — se convierte en texto con marcas de tiempo mediante Whisper-turbo, totalmente en local, sin GPU.
- El vídeo se marca en los cambios reales de plano, no fotograma a fotograma, de modo que en un minuto queda claro qué pasó en el escenario, sin tener que ver toda la grabación.
- Los ficheros de una misma noche — vídeo, audio, fotos — se agrupan en un solo evento según cuándo se grabaron o se tomaron.
- La tabla de índice se completa: qué evento, qué ficheros, qué se interpretó y cuándo.
La base de canciones acierta más cada vez
Ya hemos construido una base de letras de canciones de distintos géneros: antes de transcribir, el programa le indica al modelo qué canción probablemente está sonando, así que se le dan mucho mejor las palabras y los nombres poco habituales que a un reconocimiento de voz corriente. Esa base crece con cada archivo que procesamos — incluido el del propio local: cuantas más noches procesemos, más preciso se vuelve el reconocimiento específicamente para su repertorio habitual y sus artistas habituales.
Qué se obtiene
Para cualquier evento — un concierto, un set, una noche — se ve de inmediato qué vídeos, grabaciones y fotos le pertenecen, y qué se interpretó en cada minuto. A partir de ahí se puede:
- cortar una canción concreta por su marca de tiempo y subirla a YouTube;
- entregar a un artista su propio set sin tener que ver toda la noche;
- enviar el material a montaje con el tiempo ya marcado;
- localizar todas las grabaciones y fotos de un artista concreto en toda la historia del local — no solo en una noche.
Artistas: se confirma una vez, y a partir de ahí se encuentra solo
El mismo principio que funciona con la voz funciona con la cara en cámara — en vídeo o en foto: se confirma la identidad de alguien una vez, y el sistema lo reconoce por sí solo en cada grabación posterior, sin volver a preguntar. Se guardan varias fotos de referencia por persona en lugar de un único retrato promediado, así que el reconocimiento no falla años después, con otra iluminación o con otro corte de pelo.
En la práctica: si un artista ha tocado diez noches en dos años, con una sola confirmación el sistema encuentra las diez — sin repasar el archivo a mano cada vez que alguien necesita su propio material.
La decisión siempre es de una persona: el sistema solo propone una coincidencia con un porcentaje de similitud, y quien revisa el archivo la confirma o la rechaza. El mecanismo ya está probado sobre 20 TB de grabaciones reales de conciertos; lo que aún no hemos medido es su velocidad en el hardware propio de cada local — la misma pregunta abierta que con el reconocimiento de voz.
Lo que reconocemos honestamente que aún no hemos probado
Lo hemos ejecutado muchas veces en GPU y sabemos que existe una versión solo para CPU que funciona en principio — pero no la hemos probado en el procesador concreto del ordenador de un local. Los primeros días de cualquier piloto, con esa misma carga de trabajo incluida, mostrarán el número real: cuántos minutos de procesamiento requiere una hora de grabación en esa máquina en concreto.
Whisper-turbo es el modo de reconocimiento rápido y en bruto; el pase más lento y preciso — afinado para voces concretas — normalmente necesita GPU y no está incluido aquí. La precisión del modo turbo basta para buscar, para las marcas de tiempo y para clasificar por evento. Si más adelante hace falta un texto palabra por palabra — subtítulos para publicar, por ejemplo — es un paso aparte y más pesado que se puede añadir.
Esta configuración omite deliberadamente el modelo de lenguaje local que normalmente redacta resúmenes de documentos y describe fotos de verdad. Pero lo que sí entrega — texto con marcas de tiempo y un índice de fichero a evento — es exactamente el tipo de material compacto y ya preparado que cualquier IA en línea de propósito general (ChatGPT, Claude, Gemini, la que ya se use) sabe trabajar por su cuenta, sin ningún ajuste. Resumir una noche, buscar por significado, responder preguntas sobre el archivo siguen siendo posibles — ese trabajo simplemente ocurre a través de una herramienta en línea en el último paso, no de la nuestra local.
Sin Ollama, el sistema no escribe una descripción textual del contenido de una foto — no dirá cuál era el ambiente de la sala ni qué hay al fondo. Ya reconoce a los artistas por la cara y agrupa las fotos en eventos según cuándo se tomaron, lo cual basta para encontrar la noche y la persona correctas, pero no para obtener un relato escrito de la imagen.
Una interfaz aparte y más ligera
Para un local, esto se ejecuta como su propia versión standalone — una herramienta específica para una sola tarea, sin los ajustes y modos adicionales del producto completo. La interfaz también es propia, en tres pantallas:
Al hacer clic en una línea de texto en la tercera pantalla, la reproducción salta a ese minuto.
Siguiente paso
Un piloto funciona mejor directamente en el ordenador del local: ordenar parte de lo que ya se ha acumulado y conectar después algunas noches próximas en directo. Así se ve tanto el tamaño real del fondo acumulado como la velocidad real de procesamiento en ese hardware concreto.