La Universidad Hoy fue el sitio público de la transición presidencial de la
Universidad de Puerto Rico. Se publicó en septiembre de 2009, en hoy.upr.edu,
para dejar constancia de lo hecho y de lo que quedaba por hacer al cerrarse una
presidencia y comenzar otra. El proyecto fue dirigido por José Luis Cruz Rivera, entonces
Vicepresidente de Asuntos Estudiantiles y coordinador del plan estratégico de la
universidad, Diez para la Década, quien encabezó el equipo de transición hasta el
final de la presidencia de Antonio García Padilla el 30 de septiembre de 2009.
Hoy no queda nada de aquello en línea. El dominio hoy.upr.edu dejó de
resolver hace años, y Google Sites clásico, la plataforma sobre la que se construyó el
sitio, fue descontinuado en 2021. Lo que usted está viendo se reconstruyó en 2026 a partir
de las capturas que conservó el Wayback Machine del Internet Archive.
Conviene distinguir dos cosas. Una es el sitio de 2009, que es lo que se reproduce. La otra es esta reconstrucción, que es de 2026 y no existía entonces. Todo lo que se explica en esta página pertenece a la segunda: la franja que aparece arriba de cada página, esta misma página, las capturas que se abren al pulsar un enlace externo. El sitio original no tenía nada de eso. Lo que sí es del sitio original son sus páginas y sus documentos, y esta página explica exactamente de dónde salió cada uno.
Donde la huella que publica el archivo describe el propio fichero y no una redirección, se recalculó y se comparó: 911 coincidieron. En la sección 4 se explica por qué esa comprobación no está disponible para el resto, y qué se hizo en su lugar.
Por qué no bastó con descargar el Internet Archive
Si el archivo conservó capturas del sitio, ¿qué hubo que reconstruir? Una captura no es un sitio. El Internet Archive guarda páginas sueltas, tal como las encontró su rastreador en un momento dado. Navegarlas allí funciona hasta que uno pulsa un enlace: los documentos no abren, las imágenes faltan, la hoja de estilo no carga, y no hay manera de saber qué falta ni por qué. Reconstruir el sitio consistió en averiguar todo eso.
Lo que hubo que descubrir
El sitio vivía en dos direcciones a la vez, archivadas de forma muy distinta.
Estaba hoy.upr.edu, el dominio propio, con capturas desde 2009; y estaba la
dirección nativa de Google Sites, barrida masivamente en noviembre de 2020, poco antes del
cierre de la plataforma. Ninguna de las dos alcanza por sí sola: la primera conserva la
estructura original, la segunda llegó mucho más hondo. Reconocer que eran el mismo sitio,
y fundir ambas en un solo espacio de direcciones, fue el primer paso.
Google Sites clásico nunca servía un documento directamente. Cada enlace a un PDF era en realidad una redirección HTTP 302 hacia una dirección firmada y temporal en otro servidor de Google. Esto tiene una consecuencia incómoda: la suma de verificación que el archivo publica para ese registro describe la redirección, no el documento. Quien descargue esas direcciones sin seguir la cadena obtiene 484 archivos HTML de redirección donde debería haber 484 documentos, y si además confía en la suma publicada, creerá que están verificados.
El propio sitio llevaba dentro la lista de todo lo que contenía. Google generaba un mapa del sitio con JavaScript, y ese código incrusta la jerarquía completa en formato JSON. El script murió con la plataforma, así que la página se ve permanentemente colapsada, pero los datos siguen ahí. Recuperarlos es lo que permite decir cuántas páginas faltan en lugar de suponerlo a partir de los enlaces que uno alcanzó a ver, y es la diferencia entre un inventario y una estimación.
Había documentos que nunca estuvieron en el sitio. Quince memoriales de presupuesto se servían desde una carpeta pública de Dropbox. Dropbox retiró ese tipo de enlace en 2017 y el archivo nunca capturó los ficheros, porque eran descargas directas tras una redirección. Son invisibles para cualquier medición hecha sobre los recursos del sitio, y sin embargo el lector que pulsa el enlace pierde un documento igual.
Y había contenido que no era un archivo. El «Mensaje del Presidente» era un componente incrustado que reproducía un vídeo alojado en YouTube. Ningún rastreo de ficheros podía recuperarlo: no había fichero que recuperar. El vídeo fue borrado de YouTube y tampoco se archivó allí.
Los problemas técnicos que hubo que resolver
- Establecer el denominador. Saber qué se recuperó es fácil; saber qué faltaba exige una lista independiente de lo que debía existir. Se construyó a partir del mapa del propio sitio y del grafo completo de enlaces extraído de todas las capturas.
- Seguir las cadenas de redirección hasta el documento real y validarlo por su firma binaria, ya que la comprobación criptográfica no estaba disponible para ellos.
- Distinguir tres cosas que se parecen. Un enlace roto puede ser contenido perdido, una página que ningún rastreador capturó jamás, o simple maquinaria de la plataforma (iframes, endpoints de revisión, identificadores internos). Contarlas juntas habría exagerado la pérdida de forma considerable; la auditoría de enlaces que se publica con esta página las mantiene separadas y puede consultarse.
- Reparar 481 enlaces «View» que apuntaban a un visor de Google Docs que ya no puede abrir nada, redirigiéndolos a la copia recuperada del mismo documento.
- Recomponer el tema visual. Google servía la misma hoja de estilo desde decenas de rutas distintas; el archivo conservó unas y otras no, de modo que hubo que reconocer equivalencias entre ellas para que las páginas no quedaran sin formato.
- Resolver los enlaces salientes. Los sitios enlazados siguen existiendo, pero muestran contenido de 2026. Se sustituyeron por capturas de la época, y donde no existe ninguna, la página lo dice.
El esfuerzo
La reconstrucción se hizo en una sola sesión continua de once horas, entre José Luis Cruz Rivera y Claude, el asistente de programación de Anthropic. Produjo veintidós programas, unas 4,300 líneas de código, y en el camino indexó 3,160 registros de captura, descargó 1,422 archivos, y generó 61 capturas de pantalla de sitios enlazados. Los 484 enlaces a documentos se comprobaron uno por uno contra el servidor final, y cada referencia interna del sitio se revisa por completo cada vez que se reconstruye. Una revisión posterior del código, en una sesión aparte, consolidó esos programas y les añadió pruebas: hoy son 43 programas y unas 6,600 líneas, más de 180 comprobaciones automáticas que verifican cada cifra de esta página contra el registro. Ninguna cifra de las tablas de esta página cambió por ello. Una revisión por pares posterior sí encontró desajustes en los archivos que la acompañan — una cadena de versión, cuatro filas cuya fecha de captura no coincidía con la dirección contigua, y un recuento que ya no se podía reproducir desde la auditoría — corregidos todos, y descritos aquí.
Sin una herramienta de este tipo, el obstáculo no habría sido escribir el código. Habría sido el descubrimiento: nadie documenta que Google Sites servía sus adjuntos tras una redirección firmada, ni que el mapa del sitio lleva la jerarquía dentro de un script muerto. Esas cosas se averiguan pidiendo un PDF, recibiendo HTML, y persiguiendo el motivo.
Pero el problema mayor no es la lentitud, sino que casi todos los errores de este tipo de trabajo son silenciosos. Un despliegue informó «éxito» mientras servía errores 404 en casi todas las páginas. Un fallo propio borró la hoja de estilo de quince páginas y las dejó sin formato. Un pie de foto afirmaba conservar unas imágenes que en realidad nunca se archivaron. Una cifra de recuperación excluía dieciséis documentos perdidos por un tecnicismo sobre dónde estaban alojados. Ninguno de esos fallos se anuncia: todos parecen correctos hasta que alguien los comprueba. Verificar, y volver a verificar después de cada cambio, es lo único que los encuentra.
El método
Todo el proceso está automatizado en programas que pueden volver a ejecutarse, y se gobierna desde un registro único: nada cuenta como recuperado hasta que sus bytes están en disco y verificados. Los originales sin modificar se guardan aparte de la reconstrucción, de modo que ésta puede rehacerse desde cero sin volver a consultar el archivo, y cada cifra de esta página se calcula desde el registro al compilar y puede recomputarse desde los archivos de abajo; las afirmaciones fechadas sobre el propio trabajo son constancia de lo que se hizo, no valores que se recalculen. El resto de esta página es ese registro.
1. Identificación
| Sitio original | hoy.upr.edu, La Universidad Hoy, publicado en septiembre de 2009 |
|---|---|
| Dirección nativa | sites.google.com/a/upr.edu/launiversidadhoy |
| Institución | Universidad de Puerto Rico |
| Fuente de la reproducción | Wayback Machine, Internet Archive (web.archive.org) |
| Rango de capturas | 2009-09-29, 2024-08-05 |
| Fecha de la reconstrucción | 2026-07-28 / 29 |
El rango de capturas llega hasta 2024, pero eso no significa que el sitio siguiera vivo todo ese tiempo. Mide cuánto tiempo el archivo siguió visitando un sitio que ya no cambiaba. El contenido es de 2009. Cuatro de cada cinco registros de captura provienen de un solo barrido de noviembre de 2020, hecho antes del cierre de Google Sites; apenas un 14% corresponde a los años 2009-2012, y lo posterior a 2020 son unas pocas visitas sueltas.
2. Autoría y método de trabajo
La reconstrucción se realizó en una sola sesión de trabajo entre José Luis Cruz Rivera y Claude, el asistente de programación de Anthropic, utilizando Claude Code. Se revisó y amplió durante los dos días siguientes en sesiones aparte, con el mismo arreglo; los datos de abajo describen la sesión original.
| Planificación y diseño del método | Claude Fable 5 |
|---|---|
| Implementación y ejecución | Claude Opus 5 |
| Dirección, decisiones y validación | José Luis Cruz Rivera |
| Fecha | 2026-07-28 / 29 |
| Horario | 28 de julio, 21:15, 29 de julio, 06:45, MST (UTC-7), Flagstaff, Arizona |
| Intercambios en la conversación | 24 |
El método fue diseñado y acordado antes de escribir código. Todo el proceso, descarga, verificación, ensamblaje e informes, está automatizado en programas que pueden volver a ejecutarse; ningún archivo se editó a mano.
3. Fuentes
El sitio era accesible en dos direcciones equivalentes. Se indexaron las capturas de todas las direcciones que utilizó:
| Fuente | Periodo archivado | Registros |
|---|---|---|
hoy.upr.edu (dominio propio) | 2009-09-29 → 2014 | 517 |
sites.google.com/a/upr.edu/launiversidadhoy | principalmente el barrido de noviembre de 2020, previo al cierre de Google Sites | 2643 |
*-sites.googlegroups.com (servidores de adjuntos) | alcanzados siguiendo las redirecciones archivadas | n/a |
La captura más antigua que existe, de cualquier tipo, es del 29 de septiembre de 2009, es decir, la víspera del último día de la presidencia de Antonio García Padilla. El archivo alcanzó el sitio prácticamente en el momento para el que fue hecho. Esa captura demuestra que el sitio se publicó a más tardar ese día, sin depender del recuerdo de nadie.
4. Verificación de integridad
El índice CDX del Internet Archive publica, para cada captura, su propia suma de verificación SHA-1. Donde esa suma describe el archivo capturado, se recalculó sobre los bytes descargados y se comparó con la publicada.
| Descargas exitosas | 1422 |
|---|---|
| Suma SHA-1 recalculada y coincidente con la del Internet Archive | 911 |
| Páginas HTML descargadas | 684 |
| Páginas HTML verificadas por suma | 682 (99.7%) |
Los documentos PDF no admiten esta comprobación, y la razón es técnica: Google Sites
clásico nunca servía un adjunto directamente. Cada enlace a un documento era una
redirección HTTP 302 hacia una dirección firmada y temporal en un servidor
googlegroups.com. La suma que el índice publica para ese registro
corresponde a la redirección, no al documento. Esos archivos se validaron
estructuralmente, por tipo de contenido, tamaño y firma binaria. 480 llevan la firma
%PDF. Los otros 3 son archivos ZIP, que el sitio publicaba junto a sus
PDF; de esos se comprobó que fueran una carga sustancial y no una página de error.
Dos capturas HTML tardías (2022 y 2023) no coincidieron con su suma publicada. Ninguna de las dos se utiliza aquí: esas dos páginas proceden de capturas anteriores que sí verificaron. Todas las páginas que se muestran en esta reproducción provienen de capturas verificadas por suma.
5. Selección de capturas
El sitio original se publicó una vez, para coincidir con el último día de la presidencia de Antonio García Padilla, y no se revisó después. Esa afirmación se comprobó en lugar de darse por supuesta. El HTML siempre difiere entre años, porque Google modificaba su propia estructura de página, así que la comparación se hizo sobre el texto extraído y no sobre el marcado.
De 65 páginas capturadas más de una vez, dos páginas de contenido difieren, y la diferencia va en dirección de pérdida. La captura del 29 de septiembre de 2009 conserva entradas de navegación que las capturas posteriores ya no tienen: Blog, Diez para la Década, Avanza y La Universidad: Inversión Estratégica de Puerto Rico. Las otras cuatro páginas que difieren son páginas que Google generaba dinámicamente (cambios recientes, búsqueda, mapa del sitio) y no forman parte del contenido del sitio.
Decisión: se utiliza la captura verificada más antigua de cada página, por ser demostrablemente la más completa y la más próxima a la publicación.
El conjunto versions/ conserva todas las capturas distintas de
todas las páginas, sin modificar, de manera que esta decisión puede revisarse o revertirse
sin volver al archivo.
Como el rastreador temprano no alcanzó todas las páginas, la reproducción no procede uniformemente de 2009. El origen por año de captura es: 2009 (6 páginas), 2010 (36), 2011 (10), 2012 (8), 2019 (1) y 2020 (35). Dado que el texto de esas páginas no difiere entre capturas, esto afecta a la antigüedad de la captura, no al contenido.
6. Registro de modificaciones
Esta es la lista completa de las diferencias entre los archivos originales y lo que se muestra aquí.
Estructurales, necesarias para que el sitio funcione fuera de línea
- Reescritura de enlaces. Las direcciones absolutas que apuntaban a
hoy.upr.eduo a la dirección nativa se convirtieron en rutas relativas. El texto, el orden y el destino de los enlaces no cambian. - Declaración de codificación. El archivo servía
charset=utf-8únicamente en la cabecera HTTP; las páginas no llevan<meta charset>. Un servidor de archivos estáticos no reproduce esa cabecera, por lo que los acentos se mostraban corrompidos (Estratégico). Se insertó una etiqueta<meta charset="utf-8">en cada página. Es una etiqueta que no estaba en los bytes originales; sólo afecta a la interpretación de la codificación, no altera ningún carácter del texto. - Recursos de tema. Las hojas de estilo, scripts e imágenes del tema se servían
desde
www.gstatic.com. Se descargaron desde el Internet Archive (no de Google hoy) y se sirven localmente. - Los enlaces sin destino se muestran en gris. Es una convención uniforme en todo el sitio: cuando aquello a lo que apuntaba un enlace no puede mostrarse, el enlace aparece en gris y abre una página que explica qué había allí y por qué no está. Se aplica por igual a documentos que ningún rastreo capturó, a páginas que el archivo no conserva y a los enlaces que abrían consultas a bases de datos que ya no existen. El texto y el orden de los enlaces no cambian; cambia el color y el destino. Se hace así, en lugar de suprimirlos, porque un enlace que existió documenta qué ofrecía el sitio, y borrarlo sería borrar esa evidencia.
- El buscador del sitio se reconstruyó. La caja «Search this site» aparece en todas las páginas y sigue enviando la consulta, pero el buscador original de Google Sites consultaba un índice alojado en sus servidores: tanto el índice como el servicio desaparecieron. La caja llevaba a una página de resultados archivada que nunca podía responder, de modo que una búsqueda sin resultados podía leerse como «ese documento no existía». Se sustituyó por un índice construido al compilar el sitio y consultado en el navegador. Cubre el texto de las páginas reproducidas y el de los documentos: de los 566 documentos indexados, 378 llevan capa de texto y se pueden buscar por su contenido; los otros 188 son digitalizaciones en imagen, sin texto, y sólo se encuentran por su título. Ese total supera los 483 de la sección 7 porque incluye además las 85 cartas circulares recuperadas de las capturas del propio portal de la UPR, que la sección 7 deja fuera del titular por proceder de otro servidor. No se aplicó reconocimiento óptico de caracteres, y no se alteró ningún documento. La propia página de resultados declara esta distinción, porque «no hay resultados» y «no se puede buscar» no son la misma respuesta.
De contenido, divergencias declaradas
- Un vídeo restituido desde una copia personal. El panel «Mensaje del
Presidente» era un componente de Google Sites que incrustaba un vídeo de YouTube
(identificador
VDtJX5AQ9Iw). Nunca fue un archivo del sitio, por lo que ningún rastreo podía recuperarlo; el vídeo fue eliminado de YouTube y tampoco se archivó allí. José Luis Cruz Rivera aportó el MP4 original desde una copia de seguridad personal. Se muestra en su lugar, marcado en el código comodata-provenance="personal-backup"y registrado por separado: no se contabiliza como material recuperado del archivo. Es el único archivo de esta reproducción que no procede del Internet Archive. - Un enlace roto desactivado. La portada enlazaba
UPRINVERSIONESTRATEGICA.pdf(«La Universidad: Inversión Estratégica de Puerto Rico»). Ese documento no existe en ningún archivo bajo ninguna forma de dirección. Su enlace se convirtió en texto plano: el texto sigue visible en la página; sólo se retiró el hipervínculo inservible. El marcado original se conserva sin modificar y el documento sigue figurando en el informe de lagunas. - Dos enlaces redirigidos.
junta-de-subastasyjunta-de-apelaciones-1figuraban en la navegación del sitio desde 2009, pero ningún rastreador llegó a capturar ninguna de las dos direcciones. Cuando se intentó por primera vez (julio de 2011 en un caso, noviembre de 2020 en el otro) ya devolvían error 404. Tampoco aparecen en las capturas del mapa del sitio desde octubre de 2009. No es posible determinar a partir del archivo si esas páginas llegaron a existir: entre la aparición del enlace y el primer intento de captura median dos años en un caso y once en el otro. Abren una página que explica exactamente esto. Una versión anterior de esta reconstrucción las enlazaba a la página actual de cada organismo enupr.edu; se retiró, porque ofrecer una página de 2025 en lugar de una perdida disimula la pérdida aunque se etiquete. - El informe anual 2008-2009, vuelto a enlazar. Este documento no estaba
disponible cuando el sitio se publicó. José Luis Cruz Rivera lo sometió para publicación
más tarde, cuando ya estaba disponible y él había dejado su posición, y por eso el enlace
aparece en las capturas a partir de enero de 2010 y no en la portada de septiembre de
2009 que sirve de base a esta reconstrucción. El documento sí se recuperó, así que dejarlo
sin enlazar lo habría dejado presente pero inalcanzable desde la navegación. Se añadió a
la lista «Informes Anuales UPR», con el atributo
data-added="1"y una nota explicativa. Es un enlace que la portada de septiembre de 2009 no tenía. Ningún otro material posterior se trajo de vuelta. - Los enlaces externos abren capturas de época. El sitio enlazaba a ocho propiedades de la UPR en su barra lateral y, a lo largo de sus páginas, a recintos, agencias acreditadoras y servicios. Esos servidores siguen existiendo, pero muestran contenido de 2026. Cada enlace externo abre ahora una página local con la captura de ese sitio más cercana al 29 de septiembre de 2009, con la fecha de captura indicada en el pie, más enlaces al sitio actual y al Internet Archive. Solo se muestran capturas de la época (2012 o anteriores): una captura posterior no documenta lo que el sitio enlazaba, así que cuando el archivo no conserva ninguna del periodo, la página lo dice en vez de mostrar una versión de 2013 o 2025. Cada captura lleva además una nota de que una copia archivada solo muestra lo que el rastreador alcanzó a guardar.
- Aviso de reconstrucción y esta página. Se añadió una franja en la parte superior de cada página, deliberadamente ajena al diseño del sitio, que identifica el documento como reproducción y enlaza aquí. Ni la franja ni esta página formaban parte del sitio original.
- Controles muertos heredados del tema de Google Sites. «Sign in», «Terms», «Report Abuse», «Print page» y la marca «Powered by Google Sites» los servía la plataforma en todas las páginas y se reproducen tal cual. Conducían a Google, no a este sitio, y hoy no conducen a ninguna parte. No son fallos de la reconstrucción y no se reparan: quitarlos sería editar la página que el archivo capturó.
Lo que no se hizo
No se editó, reescribió, corrigió ni reordenó ningún texto. No se alteró ningún documento: todos los PDF son idénticos byte a byte a los que sirvió el archivo. No se modificaron fechas, autorías ni metadatos. No se redactó ninguna página nueva de contenido. Lo único que se añadió a lo que el propio sitio ofrecía es el vídeo restituido (modificación 6) y el enlace al informe 2008-2009 (modificación 9); todo lo demás que describe esta página —la franja, esta misma página, las páginas de destino tras los enlaces externos— pertenece a la reconstrucción y está señalado como tal. No se retiró nada del registro: el texto del único enlace desactivado sigue visible, y cada laguna está enumerada en el informe correspondiente.
7. Lo que falta
Se recuperaron 711 de 729 recursos (97.5%) de todo lo que el sitio ofrecía: 483 de 484 documentos alojados en el propio sitio y 82 de las 83 páginas que enumera su mapa (la restante es una plantilla vacía de Google Sites).
Medido únicamente sobre lo que el sitio alojaba, la cifra sería 710/713 (99.6%). No se usa como titular porque deja fuera los 16 documentos que el sitio publicaba desde una carpeta pública de Dropbox, 15 de ellos igualmente perdidos: para quien pulsa el enlace, el documento no aparece en ninguno de los dos casos.
No se recuperaron:
- 15 documentos alojados fuera del sitio, en su mayoría la serie Memorial del Presidente de la UPR, Presupuesto (2002-2003 a 2009-2010). Estaban en una carpeta pública de Dropbox; Dropbox retiró ese tipo de enlaces en 2017 y el Internet Archive nunca capturó los archivos, porque eran descargas directas tras una redirección.
UPRINVERSIONESTRATEGICA.pdf, ningún rastreador lo capturó jamás. Estaba enlazado una sola vez, desde la portada, únicamente en la captura del 29 de septiembre de 2009.- Dos destinos de navegación que ningún rastreo capturó y que ya devolvían error cuando se intentaron por primera vez (modificación 8).
- El vídeo incrustado, recuperado desde una copia personal en lugar de un archivo (modificación 6).
Conciliación entre la cifra principal y el inventario. inventory.csv enumera 710 archivos, no 711: recoge lo recuperado del archivo, y el vídeo procede de una copia personal (modificación 6), de modo que cuenta en lo que el sitio ofrecía pero no en lo que el archivo devolvió. Las filas de tipo página son asimismo dos más que las 82 de 83 que se informan aquí: las dos de más son la raíz del sitio y el directorio system de Google Sites, maquinaria de la plataforma y no páginas del mapa.
8. Cómo verificar
Comprobar cualquier documento. El inventario descargable enumera todos los archivos recuperados; el registro del proyecto guarda, para cada uno, la dirección exacta del Internet Archive y la fecha de captura de la que procede. Esa dirección puede consultarse hoy y compararse byte a byte.
Comprobar la lista de páginas. El mapa del propio sitio está archivado y su código incorpora la enumeración de todas sus páginas. Ése, y no una inferencia a partir de los enlaces, es el denominador con el que se miden las cifras de completitud:
https://web.archive.org/web/20091003125041/http://hoy.upr.edu/system/app/pages/sitemap/hierarchy
Comprobar que un documento falta y no fue omitido. El índice CDX del Internet Archive puede consultarse directamente; no devuelve ningún resultado para el documento ausente bajo ninguna forma de dirección:
curl "http://web.archive.org/cdx/search/cdx?url=upr.edu&matchType=domain&filter=urlkey:.*inversionestrategica.*"
9. Evidencia descargable
Los datos en los que se basa cada cifra de este documento:
El primer archivo de la lista es el paquete completo como bag conforme a BagIt
(RFC 8493): incluye bagit.txt, bag-info.txt, el manifiesto de
carga y el manifiesto de etiquetas, con la carga bajo data/. Puede descargarse
y validarse directamente, por ejemplo con bagit.py --validate, sin necesidad de
recomponer nada. Los archivos sueltos que siguen son el mismo contenido, para quien
sencillamente quiera leer uno. provenance.jsonld recoge lo mismo en forma
legible por máquina, como W3C PROV-O. Las secciones de esta página siguen el orden de las
categorías de información de preservación del modelo de referencia OAIS (ISO 14721)
—identificación, contexto, procedencia, fijeza y acceso— porque es una forma que un
archivero lee de un vistazo, no porque nada de esto haya sido certificado con ese
criterio.
Cómo citar este depósito. Los programas, el registro de procedencia y el paquete de evidencia están depositados con identificador permanente:
Cruz Rivera, J. L. (2026). Reconstruction of hoy.upr.edu (La Universidad Hoy): pipeline, provenance record and evidence package (2.0) [Computer software]. Zenodo. https://doi.org/10.5281/zenodo.21696168
El depósito cubre los programas, los informes y la documentación. No cubre el material recuperado: las páginas y los documentos de La Universidad Hoy son registros institucionales de la Universidad de Puerto Rico y conservan los derechos que les correspondan. Se publican aquí, no en el depósito.
10. Límites conocidos
Estos son los puntos donde esta reconstrucción es más débil.
El vídeo es el único archivo que no procede de un archivo histórico
El original era un vídeo incrustado de YouTube. Fue borrado de allí y el Internet Archive nunca lo capturó. Esta copia la aportó José Luis Cruz Rivera desde un respaldo personal: es el único punto de esta reconstrucción donde la procedencia de un fichero descansa en la palabra de alguien.
Su contenido, en cambio, está corroborado desde fuera de este proyecto. La grabación es el mensaje de renuncia de Antonio García Padilla, y El Nuevo Día publicó ese mensaje en texto en su momento, bajo el titular «Mensaje de Antonio García Padilla — El Presidente de la UPR habla de su renuncia». La página del periódico se conserva en el Internet Archive, igual que su noticia de la renuncia, fechada el 19 de agosto de 2009 a las 6:40 a.m. El audio de este fichero se transcribió y se comparó con aquel texto publicado: el 84% de las palabras habladas cae dentro de tramos de ocho o más palabras consecutivas que también aparecen en el periódico, en 21 tramos, el más largo de 43 palabras. El contenedor del propio fichero registra una fecha de creación del 18 de agosto de 2009 a las 21:41:42, la víspera de la reunión de la Junta de Síndicos que se extendió hasta la madrugada y terminó con la renuncia.
Eso establece qué es la grabación. No establece que este fichero sea exactamente el que el sitio incrustaba: una recodificación no deja rastro y la fecha de un contenedor puede fijarse en cualquier valor. Lo que descarta es que el mensaje sea otra cosa distinta de lo que se presenta.
Ambas noticias se citan por su copia archivada y no por su dirección en el sitio del periódico, que ya no resuelve. La transcripción se publica junto al resto de la evidencia, de modo que la comparación pueda repetirse:
https://web.archive.org/web/20090823012142/http://www.elnuevodia.com/mensajedeantoniogarciapadilla-605434.html
https://web.archive.org/web/20090821024526/http://www.elnuevodia.com/dimiteantoniogarciapadilla-604992.html
Lo que sí se puede garantizar es que el fichero no cambie a partir de ahora. Sus valores de fijeza quedan registrados aquí:
| Fichero | UPR-Mensaje-Presidente-18-ago.mp4 |
|---|---|
| Tamaño | 27,722,817 bytes |
| Formato | ISO Media, MP4 versión 2 (ISO/IEC 14496-14), marca mp42 |
| Duración | 4:49 según el reproductor; el contenedor registra 290 s |
| SHA-256 | 79de0fe605248c01eca3c662b77d8ce34f4fa0b315fe13aedf9590ec4535adca |
| SHA-1 | 9e45bab2a782d4cb9dd387a41f2d6f316b91edfc |
Ningún contenido original pasó por un modelo de lenguaje
Conviene decirlo con precisión, porque la declaración de que «ningún archivo se editó a mano» no lo cubre. Los modelos escribieron los programas, esta página y los textos de las páginas intermedias de enlaces externos. Ningún byte del contenido del sitio original pasó por un modelo de lenguaje. Los programas copian bytes desde el archivo al disco y los verifican; el contenido no se lee dentro de un modelo, ni se resume, ni se regenera, ni se corrige. Todo texto de este sitio escrito por un modelo pertenece a la reconstrucción y está señalado como tal.
Hay una excepción, que se declara aquí porque de otro modo la frase anterior no sería cierta. El audio del vídeo se transcribió automáticamente, una vez, para compararlo con el texto que publicó El Nuevo Día: la comprobación descrita más arriba. No intervino nada recuperado del archivo, ningún byte publicado cambió por ello y la transcripción no forma parte del registro.
Revisada después, pero no de forma independiente
La reconstrucción se hizo en una sola sesión continua de once horas, el 28 y 29 de julio de 2026. Esa sesión no es todo el trabajo. Durante los dos días siguientes, una revisión aparte la recorrió línea por línea, con la misma asistencia y bajo la misma dirección: se consolidaron los programas en módulos compartidos, se escribió una batería de pruebas, se añadieron cuatro etapas más y se encontraron errores, casi todos en las afirmaciones de esta página y no en el código. Una captura del año 2000 aparecía descrita como muy posterior a la página de 2009 que la enlazaba. La procedencia legible por máquina llevaba una fecha que ningún validador acepta. Un archivo de evidencia enumeraba 572 enlaces donde la auditoría publica hoy 896 destinos distintos en 4,196 referencias. Todo ello está corregido, y cada corrección consta en el registro público del depósito.
Eso es el autor releyendo su propio trabajo con mejores instrumentos. No es una revisión por pares y no es independiente: nadie ajeno a este proyecto ha examinado nada de esto. La documentación busca hacer posible ese examen —el proceso es reproducible de principio a fin y cada afirmación puede comprobarse contra el material de partida—, pero eso es una invitación, no un sustituto. Esa revisión se invita expresamente.
El denominador descansa sobre todo en una fuente
La lista de páginas que debían existir procede del mapa del propio sitio, contrastada con el grafo de enlaces extraído de todas las capturas. Ambas fuentes coinciden, pero el mapa es la autoridad y sobrevive en una sola captura. Si algún día apareciera un inventario independiente (registros administrativos de Google Sites, analíticas de la época) valdría la pena reconciliarlo con el nuestro.
La reconstrucción también puede perderse
Un proyecto que existe porque un sitio desapareció necesita su propio plan de
continuidad. Los programas, el registro de procedencia y el paquete de
evidencia llevan ya un identificador permanente (10.5281/zenodo.21696168), el depósito está archivado en Software Heritage
(swh:1:dir:d45297581ed513823d817a8c2d1d3e67c72762bc) y esta reconstrucción está archivada en el Internet Archive
(2026-07-29). Lo que sigue
dependiendo de una infraestructura personal es el sitio en sí: el dominio y el
alojamiento. Los documentos recuperados no: siguen existiendo en el Internet Archive,
de donde salieron.