O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
Antes del algoritmo: ética de la  
información y responsabilidad en  
los datos de entrenamiento de la  
inteligencia artiꢀcial generativa  
Before the Algorithm: Information  
Ethics and Responsibility in  
Generative Artiꢀcial Intelligence  
Training Data  
Alejandro Villegas Muro  
Universidad Autónoma de Chihuahua  
Recibido: 2026/08/21  
Aceptado para su publicación: 2026/08/25  
Publicado: 2026/08/31  
4 6  
Resumen: La inteligencia artiꢀcial generativa utiliza grandes volúmenes de información para entrenar mod-  
elos computacionales. Este artículo sostiene que la responsabilidad ética debe examinarse desde una etapa pre-  
via a los resultados: la selección, recopilación, transformación e incorporación de información a los conjuntos  
de entrenamiento. Mediante una investigación documental crítico-interpretativa se analizan aportaciones so-  
bre ética de la información, documentación de conjuntos de datos, procedencia, gobernanza, sesgos, consen-  
timiento y marcos internacionales de inteligencia artiꢀcial. A partir del análisis se propone una cadena de re-  
sponsabilidad informacional con seis dimensiones: procedencia, legitimidad de uso, calidad, representación,  
trazabilidad y responsabilidad. La propuesta distingue accesibilidad técnica de legitimidad ética y plantea que  
una inteligencia artiꢀcial responsable requiere gobernar también las condiciones informacionales que hacen  
posible su desarrollo tecnológico.  
Palabras clave: inteligencia artiꢀcial, ética de la tecnología, datos de entrenamiento, procedencia de la infor-  
mación, responsabilidad informacional.  
Abstract: Generative artiꢀcial intelligence uses large volumes of information to train computational models.  
ꢁis article argues that ethical responsibility should be examined before model outputs, beginning with the  
selection, collection, transformation, and incorporation of information into training datasets. ꢁrough crit-  
ical-interpretive documentary research, it analyzes specialized contributions on information ethics, dataset  
documentation, provenance, governance, bias, consent, and recent international artiꢀcial intelligence frame-  
works. Based on this analysis, the article proposes an information responsibility chain composed of six dimen-  
sions: provenance, legitimacy of use, quality, representation, traceability, and responsibility. ꢁe proposal  
distinguishes technical accessibility from ethical legitimacy and argues that responsible artiꢀcial intelligence  
requires governance not only of models and outputs, but also of the informational conditions, decisions, and  
practices that make their technological development possible.  
Keywords: artiꢀcial intelligence, ethics of technology, training data, information provenance, information  
responsibility.  
Cuando estos contenidos se recopilan, ꢀltran,  
fragmentan, etiquetan, combinan o convierten en  
unidades procesables para un sistema, ocurre una  
I. Introducción  
transformación que no es solamente técnica. Tam-  
bién cambia su contexto de utilización.  
Antes de que un gran modelo de lenguaje genere con-  
tenidos, necesita haber sido entrenado con grandes  
cantidades de datos. Buena parte procede de infor-  
Esta cuestión se vuelve especialmente importante  
en los modelos generativos debido a la escala de los  
mación creada originalmente con otros propósitos:  
conjuntos utilizados para su entrenamiento. La in-  
artículos cientíꢀcos, libros, páginas instituciona-  
vestigación sobre grandes corpus de texto ha mostra-  
les, conversaciones, publicaciones en redes sociales,  
do que las fuentes recopiladas mediante rastreo de  
código informático y materiales depositados en re-  
positorios.  
la web pueden ser heterogéneas, insuꢀcientemente  
documentadas y resultado de múltiples procesos de  
4 7  
O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
ꢀltrado. El estudio de Jesse Dodge y colaboradores so-  
bre el corpus C4 identiꢀcó procedencias inesperadas  
y mostró que determinadas prácticas de ꢀltrado mod-  
iꢀcaban la composición del conjunto de datos.1 Su  
análisis resulta importante porque evidencia que un  
corpus aparentemente técnico incorpora decisiones  
sobre qué información entra, cuál se elimina y qué  
termina representando el mundo textual disponible  
para el modelo.  
La aparición de modelos de propósito general ha  
aumentado la diꢀcultad. En muchos casos ya no se  
trata de un conjunto pequeño diseñado para una tar-  
ea concreta, sino de agregaciones de fuentes distintas  
que atraviesan repositorios, conjuntos derivados,  
procesos de limpieza y nuevas combinaciones. Shayne  
Longpre y colaboradores, mediante una auditoría de  
más de 1,800 conjuntos de datos textuales, encon-  
traron problemas importantes en la documentación  
de licencias y atribución.4 El problema de la proce-  
dencia adquiere así una dimensión práctica. Cuando  
el linaje de los datos se vuelve diꢂcil de reconstruir,  
también se diꢀculta determinar qué autorizaciones  
existían, cuáles eran las condiciones originales de  
uso y quién debería responder por decisiones toma-  
das a lo largo de la cadena.  
El problema tampoco se limita a la calidad técni-  
ca. Emily M. Bender y Batya Friedman habían plant-  
eado, antes de la actual expansión de la inteligencia  
artiꢀcial generativa (IAG), la necesidad de documen-  
tar las poblaciones y contextos de los datos utilizados  
en el procesamiento del lenguaje natural.2 Su argu-  
mento partía de una preocupación cientíꢀca y ética:  
emplear información producida por determinados  
grupos para desarrollar sistemas destinados a otros  
A esto se añade el consentimiento. La web fue con-  
struida para facilitar publicación, enlace, lectura,  
puede generar exclusiones, errores de generalización indexación y circulación de información, no para re-  
y representaciones inadecuadas. Más adelante, Tim- solver de manera anticipada todos los usos que varias  
nit Gebru y colaboradores propusieron las datasheets décadas después serían posibles mediante sistemas  
for datasets como una práctica sistemática para doc- generativos. Un análisis posterior de Longpre y co-  
umentar la motivación, composición, recopilación  
laboradores sobre miles de dominios web encontró  
y usos previstos de los conjuntos de datos.3 La idea un incremento de restricciones especíꢀcas relaciona-  
común en estos trabajos es sencilla pero relevante:  
comprender un sistema requiere conocer también  
aquello con lo que fue construido.  
das con la utilización de contenidos por sistemas de  
inteligencia artiꢀcial y, al mismo tiempo, inconsis-  
tencias entre diferentes mecanismos empleados para  
expresar preferencias de acceso y reutilización.5 El  
fenómeno muestra que la discusión no puede resolv-  
1 Jesse Dodge et al., “Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus,” en Pro-  
ceedings of the 2021 Conference on Empirical Methods in Natural Language Processing. (Association for Computational  
Linguistics, 2021), 1286–1305, https://doi.org/10.18653/v1/2021.emnlp-main.98.  
2 Emily M. Bender y Batya Friedman, “Data Statements for Natural Language Processing: Toward Mitigating System Bias  
and Enabling Better Science,” Transactions of the Association for Computational Linguistics 6 (2018): 587–604, https://doi.  
org/10.1162/tacl_a_00041.  
3 Timnit Gebru et al., “Datasheets for Datasets,” Communications of the ACM 64, núm. 12 (2021): 86–92, https://doi.  
org/10.1145/3458723.  
4 Shayne Longpre et al., “A Large-Scale Audit of Dataset Licensing and Attribution in AI,” Nature Machine Intelligence 6  
(2024): 975–87, https://doi.org/10.1038/s42256-024-00878-8.  
5 Shayne Longpre et al., “Consent in Crisis: ꢁe Rapid Decline of the AI Data Commons,” Advances in Neural Information  
Processing Systems 37 (2024): 108042–87, https://doi.org/10.52202/079017-3431.  
4 8  
erse simplemente identiꢀcando qué contenido era  
técnicamente descargable.  
El objetivo es desarrollar este argumento y pro-  
poner, como resultado del análisis, una cadena de re-  
sponsabilidad informacional para los datos de entre-  
namiento. Esta cadena comprende seis dimensiones  
relacionadas entre sí: 1) procedencia, 2) legitimidad  
de uso, 3) calidad informativa, 4) representación, 5)  
trazabilidad y 6) responsabilidad. No pretende susti-  
tuir los marcos existentes de gobernanza de datos ni  
presentarse como una lista exhaustiva de requisitos.  
Su ꢀnalidad es ofrecer un esquema conceptual que  
permita observar el proceso de entrenamiento desde  
la perspectiva de las condiciones informacionales que  
lo hacen posible.  
La preocupación también está presente en los mar-  
cos internacionales. La Recomendación sobre la Ética  
de la Inteligencia Artiꢀcial de la UNESCO plantea que  
la gobernanza debe atender la calidad de los datos de  
entrenamiento, los procesos de recopilación y selec-  
ción, la privacidad, la diversidad y la responsabilidad  
a lo largo del ciclo de vida del sistema.6 La preocu-  
pación se ha trasladado asimismo hacia instrumentos  
regulatorios. El Reglamento de Inteligencia Artiꢀcial  
de la Unión Europea incorpora obligaciones para los  
proveedores de determinados modelos de propósito  
general relacionadas con documentación, derechos  
de autor e información sobre el contenido utilizado  
durante su entrenamiento.7  
El trabajo se desarrolla mediante una investi-  
gación documental de alcance teórico y orientación  
crítico-interpretativa. El corpus de análisis estuvo in-  
tegrado por 17 documentos: 14 aportaciones académi-  
cas y tres documentos normativos o institucionales,  
seleccionados por su relación directa con la ética de  
la información, la documentación de conjuntos de da-  
tos, los sesgos en corpus de gran escala, la proceden-  
cia, el consentimiento, la transparencia y la gober-  
Estos antecedentes permiten formular el problema  
que guía este trabajo: ¿qué principios éticos deberían  
regular la selección, incorporación y utilización de  
información como datos de entrenamiento para siste-  
mas de IAG?  
La hipótesis es que la ética de la inteligencia arti- nanza de la inteligencia artiꢀcial. Estos documentos  
ꢀcial resulta incompleta cuando se concentra prin- permitieron identiꢀcar la forma en que dichos prob-  
cipalmente en el funcionamiento, despliegue y re- lemas han comenzado a incorporarse a la regulación  
sultados de los modelos. Una inteligencia artiꢀcial  
responsable requiere también una ética de la infor-  
mación de entrada, capaz de considerar procedencia,  
legitimidad de uso, calidad, representación, trazab-  
ilidad y responsabilidad durante la construcción de  
los conjuntos empleados para entrenar los sistemas.  
y a las políticas de inteligencia artiꢀcial.  
II. De la ética de la información a la ética de los  
datos de entrenamiento  
Dicho de otra forma, que una información sea técni- La ética de la información ofrece un punto de partida  
camente accesible no signiꢀca necesariamente que  
cualquier forma de incorporación, reutilización o  
transformación resulte éticamente equivalente.  
adecuado porque permite ampliar el análisis más allá  
del dispositivo o del algoritmo concreto. Luciano Flo-  
ridi ha desarrollado este campo como una perspec-  
tiva capaz de estudiar problemas morales relaciona-  
6 UNESCO, Recommendation on the Ethics of Artiꢀcial Intelligence (Paris: UNESCO, 2021).  
7 European Parliament and Council of the European Union, “Regulation (EU) 2024/1689 Laying Down Harmonised Rules  
on Artiꢀcial Intelligence (Artiꢀcial Intelligence Act),” Oꢃcial Journal of the European Union, 2024.  
4 9  
O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
dos con la creación, procesamiento, distribución y  
utilización de información dentro de una sociedad  
profundamente mediada por tecnologías digitales.8  
Su propuesta supera una comprensión estrictamente  
instrumental de las tecnologías de información. La  
información forma parte de un entorno en el que las  
personas actúan, toman decisiones, construyen iden-  
tidades y establecen relaciones.  
mente todas las relaciones sociales o editoriales que  
acompañaban al documento.  
El dato de entrenamiento añade otra transfor-  
mación: esos registros son utilizados para ajustar  
parámetros, aprender regularidades, construir rep-  
resentaciones o modiꢀcar el comportamiento de un  
sistema. Desde el punto de vista computacional esta  
transformación es necesaria. Desde el punto de vista  
Conviene distinguir tres conceptos que suelen em- ético, sin embargo, importa reconocer que el cambio  
plearse de forma intercambiable: información, dato y de función no elimina de manera automática las pre-  
dato de entrenamiento. Aunque sus fronteras pueden guntas asociadas con la procedencia.  
variar según la disciplina, la distinción permite ob-  
Por ello, la ética de los datos de entrenamiento no  
servar la transformación que interesa en este trabajo.  
puede reducirse al cumplimiento de requisitos míni-  
La información se entiende aquí como contenido mos de formato, limpieza o eꢀciencia. Las decisiones  
producido, organizado o comunicado dentro de un  
sobre datos tienen consecuencias sobre el sistema.  
contexto que le proporciona signiꢀcado. Una noti- Nithya Sambasivan y colaboradores denominaron  
cia, un artículo cientíꢀco, una fotograꢂa, una con- data cascades a los efectos acumulativos que prob-  
versación o una obra literaria no constituyen sim- lemas surgidos en el trabajo con datos pueden produ-  
plemente secuencias de caracteres o píxeles. Tienen  
autoría o procedencia, público, ꢀnalidad, momento  
de producción, condiciones de acceso y relaciones con  
otros contenidos.  
cir en fases posteriores de proyectos de inteligencia  
artiꢀcial.9 Su estudio mostró algo que suele perderse  
cuando el modelo ocupa el centro de la atención: las  
prácticas relacionadas con los datos son fundamen-  
tales, aunque dentro de ciertos procesos de desarrollo  
hayan recibido menor reconocimiento que el trabajo  
sobre modelos.  
El dato es una representación que permite regis-  
trar, almacenar, relacionar o procesar determinados  
elementos de esa información. La conversión a datos  
facilita operaciones computacionales, pero puede re-  
ducir o separar parte del contexto original.  
Bender y colaboradores han señalado que los  
grandes modelos lingüísticos presentan riesgos que  
no pueden comprenderse sin atender a los conjuntos  
masivos utilizados para entrenarlos.10 Un corpus ob-  
tenido de internet no constituye una representación  
neutral de la humanidad. Reꢄeja quién tiene acceso  
Cuando un documento es fragmentado en uni-  
dades para procesamiento, por ejemplo, la estructu-  
ra computacional obtenida no conserva necesaria-  
8 Luciano Floridi, “Information Ethics, Its Nature and Scope,” ACM SIGCAS Computers and Society 36, núm. 3 (2006):  
21–36, https://doi.org/10.1145/1195716.1195719; Luciano Floridi, ꢁe Ethics of Information (Oxford: Oxford University Press,  
2013), https://doi.org/10.1093/acprof:oso/9780199641321.001.0001.  
9 Nithya Sambasivan et al., “‘Everyone Wants to Do the Model Work, Not the Data Work’: Data Cascades in High-Stakes  
AI,” en Proceedings of the 2021 CHI Conference on Human Factors in Computing Systems (Association for Computing Ma-  
chinery, 2021), https://doi.org/10.1145/3411764.3445518.  
10 Emily M. Bender et al., “On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?,” en Proceedings of the  
2021 ACM Conference on Fairness, Accountability, and Transparency (New York: Association for Computing Machinery,  
5 0  
para publicar, qué contenidos fueron preservados,  
No todas estas preguntas tendrán la misma re-  
qué plataformas son rastreables, qué idiomas pre- spuesta jurídica en todas las jurisdicciones. Tampoco  
dominan en ellas y qué criterios se aplicaron poste- todos los problemas éticos son equivalentes a infrac-  
riormente para seleccionar información. La cantidad  
ciones legales. Precisamente por ello resulta necesa-  
de datos no elimina estas características. En oca- rio mantener una distinción entre legalidad y legiti-  
siones puede ocultarlas bajo la apariencia de escala.  
midad ética. Una práctica puede encontrarse en una  
zona jurídica todavía discutida y, aun así, requerir  
una evaluación sobre proporcionalidad, transpar-  
encia o respeto hacia quienes produjeron la infor-  
mación. Del mismo modo, una licencia técnicamente  
permisiva no garantiza que un conjunto sea represen-  
tativo o de calidad.  
En este sentido, resulta necesario diferenciar en-  
tre disponibilidad y neutralidad ética. Un conjunto de  
datos puede estar disponible para descarga y, al mis-  
mo tiempo, contener errores de licencia, información  
sensible, poblaciones insuꢀcientemente representa-  
das o contenidos cuyo contexto diꢀculta ciertos usos.  
Las propuestas de documentación planteadas medi-  
ante datasheets y data cards11 parten precisamente de  
El cambio fundamental consiste en abandonar una  
visión del dato como materia prima sin historia. En el  
que la existencia de un archivo no informa por sí mis- contexto de la inteligencia artiꢀcial, los datos poseen  
ma sobre su motivación, composición, recopilación,  
procesamiento, usos recomendados y limitaciones.  
genealogía. Reconstruirla no siempre será fácil, pero  
reconocer que existe es el primer paso para establecer  
responsabilidad.  
La ética de la información de entrada puede en-  
tenderse entonces como el conjunto de principios  
y prácticas destinados a evaluar las condiciones  
bajo las cuales contenidos previamente existentes  
son convertidos en recursos para el entrenamiento  
de sistemas artiꢀciales. Esta deꢀnición desplaza el  
análisis desde una pregunta limitada: ¿puede obten-  
erse el dato? hacia preguntas más amplias ¿de dónde  
procede?, ¿bajo qué condiciones fue producido?, ¿qué  
uso se autorizó?, ¿qué transformaciones ha sufrido?,  
¿a quién representa?, ¿quién puede resultar afectado?  
y ¿quién debe responder por su incorporación?  
III. Cuando la información se convierte en materia  
prima  
La metáfora de la información como materia prima  
resulta útil y, al mismo tiempo, problemática. Es útil  
porque describe una característica de la economía  
digital contemporánea: contenidos producidos en  
múltiples contextos pueden ser recopilados a gran es-  
cala y transformados en recursos para sistemas com-  
putacionales. Es problemática porque puede inducir  
2021), 610–23, https://doi.org/10.1145/3442188.3445922.  
11 Las datasheets for datasets (ꢀchas de documentación de conjuntos de datos) son documentos estandarizados que acom-  
pañan a un conjunto de datos y describen su motivación, composición, proceso de recopilación, tratamiento, usos previs-  
tos, limitaciones y mantenimiento, con el propósito de hacer visible su procedencia y las decisiones tomadas durante su  
construcción. Las data cards (tarjetas de datos) persiguen un objetivo similar, pero organizan esa documentación de mane-  
ra estructurada y adaptable a diferentes tipos de usuarios, incorporando información sobre contexto, metodología, usos  
recomendados, riesgos, limitaciones y consideraciones éticas. Ambas propuestas buscan aumentar la transparencia y facil-  
itar una evaluación responsable de los datos antes de utilizarlos en sistemas de inteligencia artiꢀcial. Véase Timnit Gebru et  
al., “Datasheets for Datasets,” Communications of the ACM 64, núm. 12 (2021): 86–92, https://doi.org/10.1145/3458723; Mahi-  
ma Pushkarna, Andrew Zaldivar y Oddur Kjartansson, “Data Cards: Purposeful and Transparent Dataset Documentation  
for Responsible AI,” en Proceedings of the 2022 ACM Conference on Fairness, Accountability, and Transparency, 1776–1826 (New  
York: Association for Computing Machinery, 2022), https://doi.org/10.1145/3531146.3533231.  
5 1  
O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
a pensar que esa materia se encuentra simplemente  
más básico: la posibilidad técnica de acceder a un con-  
disponible, sin relaciones anteriores de autoría, pri- tenido no permite inferir, por sí sola, las condiciones  
vacidad, propiedad, atribución o contexto.  
éticas y jurídicas de todos sus usos posteriores.  
En los procesos de entrenamiento de gran escala, la  
recopilación automatizada permite reunir volúmenes  
que ningún equipo podría revisar documento por  
El problema se acentúa cuando los conjuntos de  
datos se derivan unos de otros. La investigación so-  
bre procedencia y licenciamiento ha mostrado que  
documento. El rastreo de la web, los repositorios pú- las cadenas pueden incluir errores u omisiones que se  
blicos y la combinación de conjuntos preexistentes  
ofrecen una infraestructura eꢀciente para construir  
corpus. Sin embargo, la eꢀciencia de la recopilación  
no resuelve el estatuto de cada componente.  
propagan entre diferentes versiones y repositorios.13  
Si un conjunto es descargado, modiꢀcado, vuelto a  
publicar, combinado con otros y utilizado posterior-  
mente para crear un corpus mayor, reconstruir las  
condiciones originales se vuelve progresivamente  
más diꢂcil.  
El estudio del corpus C4 permite ilustrar este pun-  
to. Al reconstruir su composición, Dodge y colabora-  
dores encontraron contenidos de procedencias diver-  
sas y analizaron los efectos de los ꢀltros empleados  
para conformarlo.12 Lo relevante no es únicamente  
que el corpus contuviera información heterogénea.  
La cuestión del consentimiento introduce una  
diꢀcultad adicional. En la web conviven conteni-  
dos publicados bajo muy diversas expectativas. Una  
persona puede escribir en un foro esperando inter-  
También demostraron que las decisiones adopta- locución pública sin imaginar que años después el  
das durante la limpieza podían producir exclusiones  
desiguales. Esto permite cuestionar la idea de que  
texto formará parte de un sistema comercial. Una  
institución puede abrir un repositorio para facilitar  
“limpiar” datos sea una operación puramente neu- consulta académica. Un fotógrafo puede permitir vi-  
tral.  
sualización pública mientras conserva determinadas  
restricciones de reutilización. Una biblioteca puede  
digitalizar patrimonio porque se encuentra en do-  
minio público. Tratar estas situaciones como equiva-  
lentes simplemente porque pueden ser rastreadas por  
soꢅware elimina distinciones relevantes.  
Aquí aparece una distinción central para este artí-  
culo: accesibilidad no equivale a autorización.  
La frase no pretende aꢀrmar que todo contenido  
disponible públicamente requiera autorización in-  
dividual para cualquier forma de análisis. Esa con-  
clusión sería jurídicamente imprecisa y académi-  
camente poco útil. Existen contenidos en dominio  
público, obras con licencias que permiten determi-  
nados usos, excepciones legales, información insti-  
tucional destinada a reutilización y materiales expre-  
samente publicados para favorecer minería, análisis  
o redistribución. Lo que la distinción señala es algo  
Los cambios recientes en las señales mediante las  
cuales los sitios web expresan restricciones relacio-  
nadas con la recopilación automatizada muestran  
que la infraestructura web no fue diseñada para ex-  
presar con claridad todas las preferencias que actual-  
mente se esperan de ella.14 Los términos de servicio,  
archivos destinados a robots y nuevas señales espe-  
cíꢀcas para sistemas de IA pueden no coincidir. Esto  
12 Dodge et al., “Documenting Large Webtext Corpora,” 1286–1305.  
13 Longpre et al., “Large-Scale Audit of Dataset Licensing,” 975–87.  
14 Longpre et al., “Consent in Crisis,” 108042–87.  
5 2  
revela una crisis de mecanismos, no únicamente un  
ausentes, mal clasiꢀcadas o inconsistentes diꢀculta  
conꢄicto entre creadores y desarrolladores. Entre  
que desarrolladores posteriores determinen correct-  
ambos extremos se necesita gobernanza. Esto impli- amente las condiciones de uso. Una cadena de datos  
ca distinguir tipos de fuentes, condiciones de acceso, sin buena documentación produce una cadena de in-  
expectativas razonables, licencias, riesgos y ꢀnali- certidumbre.  
dades. También implica reconocer que la escala im-  
Desde la ética de la información, esta pérdida tiene  
porta. Un uso aislado y una recopilación masiva no  
tienen necesariamente la misma capacidad de afectar  
a individuos o comunidades.  
varias consecuencias. Diꢀculta reconocer a quienes  
produjeron contenidos, impide evaluar el contexto  
original, complica el retiro de información y limita la  
posibilidad de realizar auditorías posteriores. La pro-  
cedencia debería entenderse por ello como atributo  
La conversión de información en materia prima  
para inteligencia artiꢀcial debería entenderse, por  
ello, como un proceso documental sujeto a evalu- de calidad y como condición de responsabilidad.  
ación. Seleccionar datos equivale a seleccionar par-  
te del mundo informacional que será incorporado al  
sistema. Excluir también constituye una decisión. El  
Consentimiento y cambio de ꢀnalidad  
corpus ꢀnal es el resultado de ambas operaciones.  
El segundo problema es el cambio de ꢀnalidad. Una  
persona puede haber autorizado o aceptado una for-  
ma de publicación sin haber contemplado otras. Este  
punto no implica que toda reutilización requiera  
IV. Los problemas éticos de alimentar una inteli-  
gencia artiꢀcial  
necesariamente consentimiento adicional; implica  
que la ꢀnalidad original constituye información éti-  
Procedencia desconocida  
camente relevante.  
La primera diꢀcultad consiste en saber de dónde  
La diferencia puede observarse en el uso de datos  
vienen los datos. En corpus construidos mediante  
personales. Que determinada información pueda  
agregación, la ruta entre el documento inicial y el  
ser encontrada públicamente no elimina de manera  
conjunto ꢀnal puede atravesar varios intermediari-  
automática los riesgos derivados de su agregación.  
os. La procedencia puede perderse por ausencia de  
Datos dispersos pueden adquirir un signiꢀcado dif-  
metadatos, por transformaciones sucesivas, por du-  
erente cuando se combinan. La recopilación a gran  
plicación o por documentación insuꢀciente.  
escala puede aumentar posibilidades de inferencia,  
Las auditorías recientes sobre datasets15 de inteli- identiꢀcación o reutilización.  
gencia artiꢀcial muestran que este problema no es  
meramente hipotético.16 La existencia de licencias  
15 Un dataset o conjunto de datos es una colección organizada de datos reunidos para su almacenamiento, análisis o proces-  
amiento. En el ámbito de la inteligencia artiꢀcial, puede contener textos, imágenes, audios, registros numéricos u otros tipos  
de información que se emplean para entrenar, validar o evaluar modelos computacionales. Su composición, procedencia,  
calidad, representatividad y documentación inꢄuyen directamente en el comportamiento y las limitaciones de los sistemas  
desarrollados a partir de él.  
16 Longpre et al., “Large-Scale Audit of Dataset Licensing,” 975–87.  
5 3  
O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
La UNESCO ha señalado expresamente la necesi-  
dad de proteger la privacidad y los derechos de las  
personas a lo largo del ciclo de vida de los sistemas de  
inteligencia artiꢀcial.17 Este principio es importante  
porque rompe con la idea de que la ética aparece úni-  
camente durante el uso ꢀnal. Si la información per-  
sonal entra al sistema bajo condiciones deꢀcientes, el  
problema se origina antes del despliegue.  
Calidad informativa  
La tercera dimensión problemática suele recibir  
menos atención en debates centrados en derechos. In-  
ternet contiene conocimiento cientíꢀco, información  
gubernamental, periodismo, obras culturales y ma-  
teriales educativos, pero también errores, rumores,  
contenido manipulado, publicidad encubierta, dupli-  
cados, traducciones automáticas deꢀcientes y pági-  
nas producidas para atraer tráꢀco.  
Propiedad intelectual y atribución  
Este problema adquiere una nueva capa con el cre-  
cimiento del contenido sintético. A medida que textos  
e imágenes generados por modelos se publican en la  
web, los futuros corpus pueden incluir cantidades  
crecientes de información producida por sistemas an-  
teriores. La frontera entre contenido humano y sin-  
tético se vuelve menos evidente. La documentación  
de procedencia adquiere así una importancia adicio-  
nal para poder conocer qué tipos de materiales inte-  
gran nuevos ciclos de entrenamiento.  
Los derechos de autor constituyen uno de los campos  
más visibles de la controversia contemporánea. Sin  
embargo, reducir la ética de los datos de entrenamien-  
to a propiedad intelectual sería insuꢀciente. Una obra  
puede encontrarse en dominio público y seguir plant-  
eando problemas de representación o contexto. A la  
inversa, un contenido protegido puede estar sujeto  
a licencias, excepciones u otras condiciones que per-  
miten determinados usos.  
La cuestión ética central es más amplia: ¿qué ob-  
ligaciones mantiene quien obtiene valor a partir de  
información producida por terceros?  
Sesgo y representación  
La atribución proporciona un ejemplo. En la comu-  
nicación académica, reconocer las fuentes constituye  
una práctica central. Los modelos generativos com-  
plican este principio porque el entrenamiento op-  
era sobre cantidades inmensas de información y no  
siempre permite relacionar una salida con documen-  
tos concretos. Esto no signiꢀca que la atribución sea  
técnicamente trasladable de forma directa desde un  
artículo académico al entrenamiento de un modelo.  
Sí signiꢀca que la pérdida de capacidad para identiꢀ-  
car contribuciones no debería confundirse con inex-  
istencia de esas contribuciones.  
Los datos web tampoco representan de forma pro-  
porcional a todas las poblaciones. Las investigaciones  
sobre documentación de datos y modelos lingüísticos  
han advertido que las tecnologías pueden producir re-  
sultados problemáticos cuando utilizan información  
procedente de unas poblaciones para sistemas que  
posteriormente serán aplicados a otras.18  
Los estudios de grandes corpus también han  
mostrado que determinados mecanismos de ꢀltrado  
pueden eliminar de manera desproporcionada textos  
17 UNESCO, Recommendation on the Ethics of Artiꢀcial Intelligence.  
18 Bender y Friedman, “Data Statements,” 587–604; Bender et al., “Dangers of Stochastic Parrots,” 610–23.  
5 4  
vinculados con grupos minoritarios.19 En datasets  
multimodales, Abeba Birhane y colaboradores iden-  
distinto cuando se separa del entorno donde apare-  
ció. Los procesos de entrenamiento necesitan trans-  
tiꢀcaron además contenidos explícitos y estereotipos formar documentos en estructuras adecuadas para  
dañinos que evidencian los riesgos de construir con-  
juntos masivos mediante procesos insuꢀcientemente  
curados.20  
procesamiento, pero esa transformación puede dis-  
minuir señales contextuales.  
La pérdida es especialmente relevante para infor-  
El sesgo no consiste solamente en la presencia de  
mación histórica. Un documento del siglo XIX que  
contenido ofensivo. También puede expresarse medi- contiene expresiones discriminatorias posee valor  
ante ausencia. Un modelo entrenado sobre una distri- como fuente para comprender una época. Su pres-  
bución lingüística desigual tendrá una base informa- encia en un corpus sin metadatos temporales o con-  
cional diferente para cada lengua. Lo mismo ocurre  
con regiones, comunidades, tradiciones académicas o  
formas de conocimiento.  
textuales puede ser interpretada de otra manera por  
procesos posteriores. “Eliminar” todo contenido  
problemático tampoco es una solución simple, porque  
borraría evidencia histórica y cultural. El problema  
exige distinguir entre preservación, documentación  
y utilización.  
Esto permite formular una de las aꢀrmaciones  
centrales del artículo: los modelos no sólo aprenden  
de información; aprenden dentro de las desigual-  
dades de los sistemas de información de los que esa  
información procede.  
Opacidad y trazabilidad limitada  
La desigualdad informacional antecede a la inteli-  
gencia artiꢀcial. No todas las sociedades producen la  
misma cantidad de información digital, no todos los  
idiomas poseen la misma presencia en internet y no  
todas las instituciones cuentan con la misma capaci-  
dad de digitalización. Algunas comunidades apare-  
cen abundantemente documentadas mientras otras  
dependen de fuentes externas que hablan sobre ellas.  
La documentación se vuelve todavía más importante  
cuando los modelos son desarrollados por organi-  
zaciones que no publican suꢀciente información so-  
bre sus datos. Las evaluaciones del Foundation Model  
Transparency Index han señalado niveles relevantes  
de opacidad en el ecosistema de modelos fundaciona-  
les, en particular respecto de los recursos utilizados  
para construirlos.21  
Descontextualización  
La transparencia absoluta tampoco constituye  
una solución simple. Los conjuntos pueden contener  
información personal; publicar cada elemento podría  
agravar riesgos. Además, existen secretos comercia-  
les y problemas de seguridad. La alternativa no es es-  
coger entre revelar todo o no revelar nada. Es nece-  
Existe también un problema menos visible: la pérdida  
de contexto. Una frase extraída de un foro, una noti-  
cia histórica o un texto satírico puede signiꢀcar algo  
19 Dodge et al., “Documenting Large Webtext Corpora,” 1286–1305.  
20 Abeba Birhane, Vinay Uday Prabhu y Emmanuel Kahembwe, “Multimodal Datasets: Misogyny, Pornography, and Ma-  
lignant Stereotypes,” arXiv (2021), https://doi.org/10.48550/arXiv.2110.01963.  
21 Rishi Bommasani et al., “ꢁe 2024 Foundation Model Transparency Index,” Transactions on Machine Learning Re-  
search (2024); Alexander Wan et al., “ꢁe 2025 Foundation Model Transparency Index.”  
5 5  
O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
sario diseñar niveles de transparencia capaces de  
misa: la responsabilidad sobre un sistema generativo  
documentar las características relevantes sin repro- no comienza ni termina en quien interactúa con el  
ducir daños.  
modelo ꢀnal. Existen decisiones previas relacionadas  
con la recopilación, organización, selección, licenci-  
amiento, documentación y tratamiento de la infor-  
mación.  
Apropiación de valor  
Finalmente, la inteligencia artiꢀcial generativa  
plantea una cuestión sobre distribución de valor. La  
construcción de sistemas capaces de generar produc-  
tos comercialmente útiles depende, entre otros facto-  
res, de grandes cantidades de materiales producidos  
por comunidades humanas. Esa relación obliga a pre-  
guntar quién aporta valor y quién puede capturarlo.  
Procedencia → Legitimidad de uso → Calidad → Rep-  
resentación → Trazabilidad → Responsabilidad  
El orden tiene una función analítica, aunque en la  
práctica las dimensiones pueden superponerse. No  
se pretende aꢀrmar que cada dato atraviese lineal-  
mente seis departamentos o procesos técnicos. Se  
propone que cualquier estrategia de gobernanza de  
información para entrenamiento debería ser capaz  
de responder razonablemente a preguntas relaciona-  
das con estas dimensiones.  
No toda utilización de información exige compen-  
sación económica. Las bibliotecas, la investigación y  
el conocimiento abierto se sostienen precisamente  
mediante formas de circulación que no dependen de  
pago por cada consulta. Sin embargo, tampoco puede  
asumirse que todo contenido públicamente visible  
fue producido con la expectativa de contribuir a un  
servicio comercial.  
1. Procedencia: ¿de dónde viene la información?  
La ética requiere reconocer la heterogeneidad de  
esas situaciones. Una fotograꢂa con licencia comer- La primera dimensión es la procedencia. Consiste en  
cial, un texto gubernamental de libre reutilización, identiꢀcar el origen de la información con el grado de  
una obra en dominio público, un artículo bajo deter- precisión que resulte técnicamente posible y ética-  
minada licencia abierta, una conversación personal y  
un libro protegido no deberían colapsarse dentro de  
una misma categoría denominada simplemente “da-  
tos disponibles”.  
mente adecuado.  
En un corpus pequeño podría documentarse cada  
elemento. En uno de gran escala puede resultar más  
realista documentar colecciones, dominios, reposi-  
torios, fechas o categorías. El nivel de granularidad  
puede variar, pero el principio permanece: no debería  
normalizarse que conjuntos fundamentales para de-  
sarrollar un sistema carezcan de información básica  
sobre su origen.  
V. La cadena de responsabilidad informacional  
A partir de los problemas anteriores se propone una  
cadena de responsabilidad informacional para los da-  
Esta dimensión recupera aportaciones previas so-  
tos de entrenamiento. El concepto parte de una pre- bre declaraciones de datos, ꢀchas de datasets, tarje-  
5 6  
tas de datos y auditorías de procedencia.22 Todas estas  
propuestas, desde perspectivas distintas, coinciden  
en que el contexto del dato importa.  
En otro aparecen datos privados obtenidos sin autor-  
ización. Entre ambos existen numerosos casos: obras  
con distintas licencias, acceso abierto, páginas públi-  
cas con condiciones especíꢀcas, información de usu-  
arios y contenidos sujetos a excepciones legales.  
La procedencia permite responder preguntas pos-  
teriores. Sin ella es diꢂcil evaluar licencia, temporal-  
idad, población representada, calidad o posibilidades  
de retiro. La procedencia funciona, por tanto, como  
una primera condición de auditabilidad.  
La responsabilidad consiste precisamente en no  
tratar toda esta diversidad como una única categoría.  
El desarrollo de Common Pile v0.1 resulta ilustra-  
tivo porque demuestra la posibilidad de construir a  
gran escala un corpus compuesto por materiales de  
Los metadatos mínimos podrían incluir, según el  
caso, nombre de la fuente o colección, responsable de  
su creación, método de obtención, fecha de recopi- dominio público y con licencias abiertas.23 No elimi-  
lación, idioma, modalidad, transformaciones princi-  
pales y relaciones con conjuntos anteriores.  
na todos los problemas éticos, pero evidencia que la  
procedencia y las condiciones de uso pueden incorpo-  
rarse deliberadamente al diseño del conjunto.  
2. Legitimidad de uso: ¿por qué puede utilizarse?  
3. Calidad: ¿qué tan adecuada es la información?  
El segundo nivel consiste en determinar por qué su  
incorporación puede considerarse legítima.  
La tercera dimensión pregunta si los datos son ade-  
cuados para el propósito. La calidad informativa  
comprende mucho más que ausencia de archivos cor-  
ruptos. Incluye actualidad, exactitud, contexto, du-  
plicación, presencia de información falsa, conꢀabil-  
idad de las fuentes y efectos de los procedimientos de  
limpieza.  
La legitimidad incluye elementos jurídicos, pero  
no se agota en ellos. Deben considerarse derechos de  
autor, licencias, dominio público, términos aplica-  
bles, privacidad, expectativas razonables de las perso-  
nas y ꢀnalidad del tratamiento. Esta dimensión es la  
que permite precisar la aꢀrmación “accesibilidad no  
equivale a autorización”. No signiꢀca que lo accesible  
nunca pueda utilizarse. Signiꢀca que la accesibilidad  
constituye una condición técnica, mientras que la le-  
gitimidad requiere información adicional.  
Un corpus puede ser jurídicamente utilizable y, al  
mismo tiempo, ser deꢀciente. Puede estar compues-  
to enteramente por materiales con licencias claras y  
contener sesgos extremos, errores o información ob-  
soleta. Por ello, legitimidad y calidad deben evaluarse  
por separado.  
Puede imaginarse una escala de situaciones. En  
un extremo se encuentran materiales expresamente  
ofrecidos para reutilización, dominio público o con-  
juntos creados especíꢀcamente para entrenamiento.  
También debe evitarse deꢀnir calidad exclusiva-  
mente como semejanza con un estándar lingüístico  
22 Bender y Friedman, “Data Statements,” 587–604; Gebru et al., “Datasheets for Datasets,” 86–92; Pushkarna, Zaldivar y  
Kjartansson, “Data Cards”; Longpre et al., “Large-Scale Audit of Dataset Licensing,” 975–87.  
23 Nikhil Kandpal et al., “ꢁe Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text,” arXiv  
(2025), https://doi.org/10.48550/arXiv.2506.05209.  
5 7  
O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
dominante. Los estudios sobre C4 muestran que cier- de idiomas declarado por un conjunto. Es necesario  
tos ꢀltros aparentemente asociados con la limpieza  
considerar volumen relativo, variedad de fuentes y  
pueden tener consecuencias de representación.24 La calidad de la representación. Una lengua presente  
calidad no debería convertirse en un mecanismo que únicamente mediante traducciones automáticas no  
elimine variedades lingüísticas simplemente porque  
diꢀeren de formas prestigiosas o frecuentes.  
ocupa la misma posición informacional que otra rep-  
resentada mediante literatura, prensa, conversación,  
documentación institucional y producción cientíꢀca.  
Resulta más adecuado hablar de adecuación. Un  
texto histórico puede ser excelente para estudiar el  
lenguaje de una época y problemático si se interpreta  
La UNESCO ha señalado la necesidad de promov-  
er diversidad e inclusión en los conjuntos de entre-  
como descripción actual del mundo. Un foro informal namiento y prestar particular atención a contextos  
puede ser inadecuado como fuente de hechos médicos caracterizadosporescasezdedatos.25Lapreocupación  
y valioso para estudiar formas coloquiales de comu- no es decorativa. Si la inteligencia artiꢀcial se con-  
nicación. La calidad depende también del uso.  
vierte en infraestructura de acceso a la información,  
sus asimetrías pueden inꢄuir sobre quién recibe re-  
spuestas más precisas, qué referencias culturales  
reconoce y qué formas de conocimiento aparecen  
como centrales.  
4. Representación: ¿quién está y quién falta?  
La cuarta dimensión se reꢀere a las distribuciones  
del corpus. La representación no exige que todos  
los conjuntos reproduzcan proporcionalmente a la  
población mundial. Tal objetivo sería imposible en  
muchos casos. Sí exige conocer, dentro de límites ra-  
zonables, qué idiomas, regiones, tipos de fuentes y  
grupos tienen mayor o menor presencia.  
La evaluación de representación también debería  
preguntarse quién describe a quién. Una comunidad  
puede aparecer abundantemente en documentos pro-  
ducidos desde fuera y tener poca presencia mediante  
voces propias. Contar menciones no basta para deter-  
minar representación.  
Esta dimensión es importante porque las ausen-  
cias pueden ser tan signiꢀcativas como las presen-  
cias. Una lengua con escasos recursos digitales puede  
quedar subrepresentada, aunque millones de perso-  
nas la utilicen. Una comunidad predominantemente  
oral puede dejar pocas huellas disponibles para ras-  
treo web. Un país con menor infraestructura de dig-  
italización puede aparecer de manera fragmentaria.  
5. Trazabilidad y transparencia: ¿puede recon-  
struirse la trayectoria?  
La quinta dimensión no equivale a procedencia. La  
procedencia identiꢀca el origen; la trazabilidad per-  
mite seguir transformaciones. Un documento puede  
proceder de un repositorio concreto, pero después  
ser limpiado, fragmentado, mezclado, deduplicado,26  
reetiquetado y redistribuido. La trazabilidad busca  
registrar estas operaciones de manera suꢀciente para  
Las desigualdades digitales se transforman así en  
desigualdades de entrenamiento. Por ello, la diver-  
sidad no debería evaluarse sólo mediante el número  
24 Dodge et al., “Documenting Large Webtext Corpora,” 1286–1305.  
25 UNESCO, Recommendation on the Ethics of Artiꢀcial Intelligence.  
26 La deduplicación es el proceso mediante el cual se identiꢀcan y eliminan registros, documentos o fragmentos repetidos  
5 8  
comprender cómo llegó desde una fuente hasta un  
conjunto determinado.  
6. Responsabilidad y reconocimiento: ¿quién re-  
sponde?  
La importancia de esta dimensión aumenta cuan-  
do existe una cadena de intermediarios. Si un prov-  
eedor utiliza un conjunto creado por otro, necesita  
saber qué transformaciones previas ocurrieron. Si  
después combina ese material con otras fuentes, de-  
bería documentar las nuevas operaciones.  
La última dimensión integra las anteriores y pre-  
gunta quién asume responsabilidad cuando apare-  
cen problemas. Una diꢀcultad frecuente en sistemas  
complejos consiste en dispersar responsabilidad en-  
tre numerosos actores hasta que ninguno parece ser  
responsable.  
La transparencia asociada con esta dimensión  
debe ser signiꢀcativa, no necesariamente total. Pub-  
licar terabytes de archivos sin explicación puede  
ser formalmente abierto y materialmente opaco. La  
transparencia requiere organización.  
El creador del dataset puede aꢀrmar que sólo recopiló  
materiales; el desarrollador, que utilizó un conjunto  
disponible; la plataforma, que sólo alojó archivos;  
el proveedor del modelo, que no puede conocer cada  
documento; y el usuario ꢀnal, que únicamente con-  
sultó una herramienta.  
En este sentido, un documento de transparen-  
cia debería poder responder, al menos, qué tipos de  
fuentes fueron utilizados, de qué periodos proceden,  
cómo se obtuvieron, qué procedimientos de ꢀltrado  
se aplicaron, qué materiales fueron excluidos, qué  
proporción aproximada corresponde a distintas mo-  
dalidades o idiomas y qué limitaciones son conocidas.  
La existencia de una cadena real de actores no de-  
bería convertirse en una cadena de exenciones. La re-  
sponsabilidad debe asignarse de acuerdo con capaci-  
dad de decisión y control. Quien recopila información  
tiene obligaciones relacionadas con adquisición y  
documentación. Quien prepara un dataset debe reg-  
istrar transformaciones y limitaciones. Quien integ-  
ra múltiples conjuntos debe revisar las condiciones  
relevantes y conservar su trazabilidad. Quien desar-  
rolla y comercializa un modelo debe realizar debida  
diligencia sobre las fuentes que utiliza. Quien desplie-  
ga un sistema en un contexto particular debe evaluar  
La tendencia regulatoria reciente muestra una  
aproximación hacia esta idea. El Reglamento de In-  
teligencia Artiꢀcial de la Unión Europea establece  
obligaciones de documentación para proveedores de  
modelos de propósito general y exige un resumen su-  
ꢀcientemente detallado del contenido utilizado para  
el entrenamiento.27  
Puede denominarse a esto transparencia de la ge- riesgos propios de ese uso.  
nealogía informacional. La expresión hace referencia  
a la posibilidad de explicar de manera estructurada  
de qué ecosistema de información surgió el sistema.  
La responsabilidad es, por tanto, distribuida, pero  
no diluida. El reconocimiento forma parte de esta  
dimensión. No siempre será posible atribuir individ-  
ualmente cada contribución informacional al com-  
portamiento de un modelo, pero sí pueden existir  
dentro de un conjunto de datos. En los sistemas de inteligencia artiꢀcial, esta práctica busca reducir redundancias, evitar la  
sobrerrepresentación de determinados contenidos y disminuir el riesgo de que el modelo memorice información duplicada  
durante el entrenamiento.  
27 European Parliament and Council of the European Union, “Regulation (EU) 2024/1689.”  
5 9  
O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
mecanismos de reconocimiento a colecciones, comu-  
nidades, repositorios o fuentes. Cuando el desarrollo  
depende de conjuntos creados por otras instituciones,  
la documentación puede preservar ese vínculo.  
El problema surge cuando se utiliza la palabra “ab-  
ierto” sin atender a la licencia concreta. Existe una  
diferencia entre que un archivo pueda consultarse  
gratuitamente y que posea una licencia abierta deter-  
minada. También existen diferencias entre licencias  
abiertas. Algunas permiten usos comerciales, otras  
incorporan restricciones; algunas permiten obras  
derivadas bajo ciertas condiciones. Por ello, aꢀrmar  
simplemente que un artículo “está en internet” pro-  
porciona muy poca información sobre su régimen de  
reutilización.  
También deben existir vías de rectiꢀcación. Una  
gobernanza responsable debería contemplar me-  
canismos para reportar información indebidamente  
incluida, solicitar revisión, corregir metadatos, actu-  
alizar licencias o eliminar futuras versiones cuando  
corresponda.  
Las seis dimensiones forman una secuencia de pre-  
guntas: ¿De dónde viene? → ¿por qué puede utilizarse?  
→ ¿es adecuada? → ¿a quién representa? → ¿podemos  
reconstruir lo que ocurrió? → ¿quién responde?  
Esta distinción es particularmente importante  
para repositorios institucionales y bibliotecas dig-  
itales. Un repositorio puede ofrecer acceso a docu-  
mentos cuyos autores conservan derechos. Puede  
albergar obras con distintas licencias e incluso ma-  
teriales cuya consulta se permite bajo condiciones  
especíꢀcas. La infraestructura abierta no uniforma  
automáticamente el estatuto de todos sus objetos.  
La utilidad de la cadena reside en que evita reducir  
todos los problemas a una sola categoría. Un conjunto  
puede superar una dimensión y fallar en otra. Puede  
tener licencia correcta, pero representación deꢀci-  
Lo mismo sucede con el dominio público. Una  
ente; buena calidad, pero procedencia insuꢀciente- obra cuyo plazo de protección patrimonial ha expi-  
mente documentada; diversidad amplia, pero infor- rado puede ser reutilizable desde el punto de vista de  
mación personal que no debió incorporarse.  
los derechos de autor, pero el conjunto que contiene  
su digitalización puede incorporar otros elementos.  
Además, el hecho de que un material sea reutilizable  
no resuelve cuestiones como calidad, sesgo o sensibi-  
lidad cultural.  
VI. Información abierta no signiꢀca información  
libre de responsabilidad  
El movimiento de acceso abierto transformó la co-  
municación cientíꢀca al defender que la literatura  
académica pudiera circular con menos barreras. La  
Budapest Open Access Initiative formuló una deꢀn-  
ición amplia en la que el acceso abierto permite no  
sólo leer, sino también descargar, copiar, distribuir,  
buscar, enlazar y utilizar contenidos para otros ꢀnes  
lícitos, dentro de las condiciones correspondientes.28  
Las bibliotecas y archivos ofrecen una analogía  
relevante. Preservar un documento no equivale a  
aprobar su contenido. Dar acceso a una fuente tam-  
poco signiꢀca que todos sus posibles usos sean ética-  
mente indistinguibles.  
Las instituciones documentales han desarrollado  
durante décadas prácticas para contextualizar col-  
ecciones, proteger información sensible, describir  
procedencia y establecer restricciones justiꢀcadas.  
28 Budapest Open Access Initiative, “Read the Budapest Open Access Initiative,” Open Society Institute, 2002.  
6 0  
La inteligencia artiꢀcial podría beneꢀciarse de esa  
experiencia.  
investigaciones sobre señales de consentimiento en  
la web han identiꢀcado precisamente un crecimien-  
to de restricciones relacionadas con la inteligencia  
artiꢀcial.30 La pérdida de conꢀanza puede terminar  
reduciendo el bien informacional común.  
Una ética de los datos de entrenamiento debería  
distinguir, al menos, entre seis acciones: acceder,  
consultar, reproducir, reutilizar, realizar minería de  
textos y datos, y utilizar para entrenamiento.  
VII. Hacia una ética de la inteligencia artiꢀcial  
Estas acciones pueden solaparse técnicamente,  
pero no son conceptualmente idénticas. La existencia  
de derechos para una no permite inferir automática-  
mente el estatuto de las demás en todas las jurisdic-  
ciones.  
desde la información  
Durante los últimos años han surgido distintas pro-  
puestas para documentar datasets. Las declaraciones  
de datos, las ꢀchas de conjuntos de datos y las tarjetas  
de datos comparten una preocupación por hacer visi-  
bles decisiones que de otro modo quedan ocultas.31  
Esta diferenciación no tiene como propósito dar  
por terminado este análisis. Su ꢀnalidad es mejo-  
rar la seguridad jurídica y ética mediante una doc-  
umentación más precisa. Un ecosistema donde las  
licencias y condiciones sean legibles para humanos y  
máquinas podría facilitar el desarrollo responsable  
más que un escenario de incertidumbre permanente.  
La cadena propuesta en este artículo articula es-  
tas prácticas desde la perspectiva de la ética de la  
información y plantea la necesidad de reconstruir  
la trayectoria de los conjuntos de datos, documentar  
las transformaciones que experimentan e identiꢀcar  
las responsabilidades asociadas a cada etapa de su in-  
tegración y uso. De esta manera, la procedencia y la  
trazabilidad se incorporan como elementos centrales  
para una gestión responsable de la información uti-  
lizada en sistemas de inteligencia artiꢀcial.  
El proyecto Common Pile v0.1 proporciona un ejem-  
plo de que es posible construir un corpus de gran esca-  
la con materiales de dominio público o expresamente  
licenciados de forma abierta.29  
El proyecto no demuestra que toda inteligencia  
artiꢀcial pueda entrenarse exclusivamente con esa  
clase de materiales ni resuelve todas las controver-  
sias. Sí cuestiona la idea de que documentar licencias  
y procedencia sea necesariamente incompatible con  
construir corpus grandes.  
En términos operativos, los conjuntos de entre-  
namiento deberían documentar, cuando correspon-  
da y resulte técnicamente posible:  
a) origen general y principales fuentes;  
b) fecha o periodo de recopilación;  
c) mecanismos de obtención;  
Esta distinción también protege al propio movi-  
miento de acceso abierto. Si “abierto” comienza a uti-  
lizarse como sinónimo de ausencia de cualquier re-  
sponsabilidad, podrían aumentar los incentivos para  
cerrar contenidos por temor a usos no previstos. Las  
d) licencias y condiciones identiꢀcadas;  
29 Kandpal et al., “Common Pile v0.1.”  
30 Longpre et al., “Consent in Crisis,” 108042–87.  
31 Bender y Friedman, “Data Statements,” 587–604; Gebru et al., “Datasheets for Datasets,” 86–92; Pushkarna, Zaldivar y  
Kjartansson, “Data Cards.”  
6 1  
O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
e) modalidades de información incluidas;  
f) idiomas y distribución aproximada;  
g) criterios de inclusión y exclusión;  
h) procedimientos de limpieza;  
modiꢀca automáticamente modelos ya entrenados.  
La transparencia debe dejar claro qué medidas son  
técnicamente posibles y cuáles no.  
La responsabilidad informacional también necesi-  
ta proporcionalidad ya que no todos los sistemas im-  
plican el mismo nivel de riesgo ni requieren idéntica  
documentación. Un modelo experimental entrena-  
i) métodos de deduplicación;  
j) presencia y tratamiento de información per- do con un pequeño corpus institucional controla-  
sonal;  
do no plantea los mismos desaꢂos que un modelo de  
propósito general entrenado con grandes cantidades  
de contenido web. El reconocimiento institucional de  
estas necesidades está creciendo. La UNESCO esta-  
blece que los Estados deberían promover estrategias  
de gobernanza que atiendan la calidad de los datos de  
entrenamiento y la adecuación de los procedimien-  
tos de recopilación y selección.32 La Unión Europea  
avanzó posteriormente hacia obligaciones concre-  
tas de documentación para los modelos de propósito  
general.33 Estos marcos no son idénticos a la cadena  
propuesta aquí, pero muestran una transición desde  
k) utilización de información producida por  
usuarios;  
l) incorporación de datos sintéticos;  
m) sesgos o limitaciones identiꢀcados;  
n) transformaciones realizadas sobre datasets  
anteriores;  
o) mecanismos para reportar errores de proce-  
dencia o licencia;  
p) procedimientos para solicitar revisión o ex- principios generales hacia obligaciones aplicadas a la  
clusión cuando corresponda.  
información utilizada durante el entrenamiento.  
Es importante, sin embargo, no confundir trans-  
parencia con solución completa. Documentar que un  
corpus contiene determinados problemas no vuelve  
automáticamente aceptable su uso. La transparencia  
permite identiꢀcar, evaluar y discutir. La legitimidad  
requiere decisiones adicionales. De igual forma, la  
regulación no sustituye la ética. Las leyes suelen es-  
tablecer mínimos y operan dentro de jurisdicciones  
concretas. Los modelos y sus datos atraviesan fron-  
teras. Una práctica puede cumplir formalmente una  
norma local y seguir produciendo impactos sobre co-  
La trazabilidad también debería mantenerse entre  
versiones. Los datasets cambian. Se incorporan nue-  
vas fuentes, se eliminan documentos, se actualizan  
ꢀltros y se corrigen errores. Una versión posterior  
puede ser sustancialmente diferente de la anterior.  
El registro de versiones permite saber qué corpus fue  
utilizado para qué modelo y en qué condiciones.  
Esto adquiere especial importancia cuando una  
persona solicita la eliminación de información o  
cuando se identiꢀca posteriormente un problema de munidades ubicadas en otros contextos.  
licencia. Borrar un archivo de la versión actual no  
32 UNESCO, Recommendation on the Ethics of Artiꢀcial Intelligence.  
33 European Parliament and Council of the European Union, “Regulation (EU) 2024/1689.”  
6 2  
Aquí adquiere sentido la idea de una genealogía in- VIII. Conclusiones  
formacional de la inteligencia artiꢀcial. Cada sistema  
posee una historia formada por fuentes, decisiones,  
La responsabilidad ética de la inteligencia artiꢀcial  
ꢀltros, exclusiones y transformaciones. Conocer esa  
genealogía no implica reconstruir matemáticamente  
cada relación entre un documento y cada parámetro  
del modelo. Signiꢀca documentar la infraestruc-  
tura social y documental que hizo posible su entre-  
namiento.  
generativa (IAG) no comienza con la respuesta pro-  
ducida por el modelo, sino con las decisiones medi-  
ante las cuales información creada por personas,  
instituciones y comunidades se selecciona, recopila,  
transforma e incorpora a los sistemas. Desde esta pre-  
misa, el artículo propuso una cadena de responsabi-  
lidad informacional integrada por seis dimensiones:  
Esta perspectiva también modiꢀca la noción de  
innovación. La velocidad de desarrollo no debería procedencia, legitimidad de uso, calidad, represent-  
medirse únicamente por cuántos parámetros, datos o  
capacidades pueden añadirse. Un avance puede con-  
sistir en construir mejores mecanismos para identi-  
ꢀcar derechos, respetar preferencias, documentar  
fuentes, integrar lenguas poco representadas o pro-  
ducir datasets de mayor calidad.  
ación, trazabilidad y responsabilidad.  
La propuesta permite evitar dos simpliꢀcaciones.  
La primera consiste en asumir que toda información  
técnicamente accesible puede emplearse para cual-  
quier ꢀnalidad. La segunda supone que toda reuti-  
lización exige las mismas condiciones. Los conjuntos  
de entrenamiento reúnen materiales con regímenes,  
contextos y riesgos distintos, por lo que su evaluación  
requiere distinguir entre disponibilidad, legitimi-  
dad, calidad y adecuación.  
Los profesionales de la información tienen un pa-  
pel relevante en este proceso. Bibliotecólogos, archi-  
vistas, documentalistas y especialistas en gestión  
de información poseen experiencia en metadatos,  
procedencia, evaluación de fuentes, preservación,  
clasiꢀcación y derechos de acceso. La gobernanza de  
datasets no debería quedar restringida a ingeniería  
de soꢅware y derecho. Es también un problema de or-  
ganización del conocimiento.  
Los problemas tampoco se reducen a los derechos  
de autor. Un corpus compuesto por materiales legal-  
mente reutilizables puede mantener sesgos, excluir  
comunidades, incorporar información falsa o pre-  
sentar deꢀciencias de documentación. Por ello, la  
transparencia debe ofrecer información signiꢀcativa  
sobre fuentes, periodos, criterios de selección, trans-  
formaciones, idiomas, licencias, limitaciones y me-  
canismos de rectiꢀcación, sin asumir que documen-  
tar un problema basta para resolverlo.  
Incorporar esta perspectiva podría mejorar los  
equipos interdisciplinarios responsables de desarrol-  
lar inteligencia artiꢀcial. La pregunta técnica ¿cómo  
obtenemos más datos? se complementaría con pre-  
guntas informacionales: ¿qué datos necesitamos?,  
¿qué representan?, ¿cómo fueron documentados?,  
¿qué condiciones los acompañan? y ¿qué información  
estamos dejando fuera?  
La responsabilidad es distribuida entre quienes  
producen, recopilan, organizan, transforman y utili-  
zan la información, pero no debe diluirse entre esos  
actores.  
6 3  
O R E X I S  
/
E x p l o r a c i o n e s é t i c a s  
Su asignación debe corresponder a las decisiones  
y capacidades de control de cada participante en la  
cadena.  
Bommasani, Rishi, Kevin Klyman, Sayash Ka-  
poor, et al. “ꢁe 2024 Foundation Model Transparency  
Index.” Transactions on Machine Learning Research,  
2024. https://openreview.net/forum?id=38cwP8xVxD.  
La ética de la información recuerda, ꢀnalmente,  
que los datos tienen historia. Antes de convertirse en  
material de entrenamiento fueron documentos, ex-  
presiones, registros o representaciones situadas en  
contextos humanos. Una IAG responsable requiere  
preguntar de qué información aprendió, cómo fue ob-  
tenida, qué condiciones acompañaron su uso, quién  
quedó representado o excluido y quién asumió la de-  
cisión de incorporarla.  
Budapest Open Access Initiative. “Read the Bu-  
dapest Open Access Initiative.” Open Society Institute,  
read/.  
Dodge, Jesse, Maarten Sap, Ana Marasović, et  
al. “Documenting Large Webtext Corpora: A Case  
Study on the Colossal Clean Crawled Corpus.” En Pro-  
ceedings of the 2021 Conference on Empirical Methods  
in Natural Language Processing, 1286–1305. Associa-  
tion for Computational Linguistics, 2021. https://doi.  
org/10.18653/v1/2021.emnlp-main.98.  
La ética de la inteligencia artiꢀcial comienza, por  
tanto, antes de evaluar lo que el modelo produce:  
comienza en las condiciones bajo las cuales se decide  
de qué información puede aprender.  
European Parliament and Council of the Eu-  
ropean Union. “Regulation (EU) 2024/1689 Laying  
Down Harmonised Rules on Artiꢀcial Intelligence  
(Artiꢀcial Intelligence Act).” Oꢃcial Journal of the  
European Union, 2024. https://eur-lex.europa.eu/eli/  
reg/2024/1689/oj.  
Referencias  
Bender, Emily M., y Batya Friedman. “Data  
Statements for Natural Language Processing: Toward  
Mitigating System Bias and Enabling Better Science.”  
Transactions of the Association for Computational  
Linguistics 6 (2018): 587–604. https://doi.org/10.1162/  
tacl_a_00041.  
Floridi, Luciano. “Information Ethics, Its  
Nature and Scope.” ACM SIGCAS Computers  
and Society 36, núm. 3 (2006): 21–36. https://doi.  
org/10.1145/1195716.1195719.  
Floridi, Luciano. ꢁe Ethics of Information.  
Oxford: Oxford University Press, 2013. https://doi.  
org/10.1093/acprof:oso/9780199641321.001.0001.  
Bender, Emily M., Timnit Gebru, Angelina Mc-  
Millan-Major y Shmargaret Shmitchell. “On the Dan-  
gers of Stochastic Parrots: Can Language Models Be  
Too Big?” En Proceedings of the 2021 ACM Conference  
on Fairness, Accountability, and Transparency, 610–  
23. New York: Association for Computing Machinery,  
2021. https://doi.org/10.1145/3442188.3445922.  
Gebru, Timnit, Jamie Morgenstern, Briana Vec-  
chione, et al. “Datasheets for Datasets.” Communica-  
tions of the ACM 64, núm. 12 (2021): 86–92. https://doi.  
org/10.1145/3458723.  
Kandpal, Nikhil, Brian Lester, Colin Raꢆel, et al.  
“ꢁe Common Pile v0.1: An 8TB Dataset of Public Do-  
main and Openly Licensed Text.” arXiv, 2025. https://  
doi.org/10.48550/arXiv.2506.05209.  
Birhane, Abeba, Vinay Uday Prabhu y Emmanu-  
el Kahembwe. “Multimodal Datasets: Misogyny, Por-  
nography, and Malignant Stereotypes.” arXiv, 2021.  
https://doi.org/10.48550/arXiv.2110.01963.  
6 4  
Longpre, Shayne, Robert Mahari, Anthony  
Chen, et al. “A Large-Scale Audit of Dataset Licensing  
and Attribution in AI.” Nature Machine Intelligence  
6 (2024): 975–987. https://doi.org/10.1038/s42256-024-  
00878-8.  
Longpre, Shayne, Robert Mahari, Ariel Lee, et  
al. “Consent in Crisis: ꢁe Rapid Decline of the AI Data  
Commons.” Advances in Neural Information Pro-  
cessing Systems 37 (2024): 108042–108087. https://doi.  
org/10.52202/079017-3431.  
Pushkarna, Mahima, Andrew Zaldivar y Oddur  
Kjartansson. “Data Cards: Purposeful and Transpar-  
ent Dataset Documentation for Responsible AI.” En  
Proceedings of the 2022 ACM Conference on Fairness,  
Accountability, and Transparency, 1776–1826. New  
York: Association for Computing Machinery, 2022.  
https://doi.org/10.1145/3531146.3533231.  
Sambasivan, Nithya, Shivani Kapania, Hannah  
Highꢀll, Diana Akrong, Praveen K. Paritosh y Lora M.  
Aroyo. “‘Everyone Wants to Do the Model Work, Not  
the Data Work’: Data Cascades in High-Stakes AI.” En  
Proceedings of the 2021 CHI Conference on Human  
Factors in Computing Systems, artículo 39, 1–15. New  
York: Association for Computing Machinery, 2021.  
https://doi.org/10.1145/3411764.3445518.  
UNESCO. Recommendation on the Ethics of Ar-  
tiꢀcial Intelligence. Paris: UNESCO, 2021. https://un-  
esdoc.unesco.org/ark:/48223/pf0000380455  
Wan, Alexander, Kevin Klyman, Sayash Ka-  
poor, et al. “ꢁe 2025 Foundation Model Transparen-  
cy Index.” arXiv, 11 de diciembre de 2025. https://doi.  
org/10.48550/arXiv.2512.10169.  
6 5