Créditos y licencias
El código y los paquetes de reglas de RadiografIA tienen licencia Apache 2.0. Lo ajeno que usa esta web conserva sus propias condiciones: aquí está cada pieza, con la atribución que pide su licencia.
Los textos de personas
El resultado compara tu texto con textos escritos por personas, del mismo tipo y de la misma longitud. De esos textos, la web solo lleva cifras, los percentiles de cada medida: ni una frase. Estos son sus corpus.
Noticias
UD Spanish-AnCora r2.18: noticias de la agencia EFE y de El Periódico, del año 2000. De Taulé, Martí y Recasens (AnCora, CLiC-UB); conversión a Universal Dependencies de Martínez Alonso y Zeman. Licencia CC BY 4.0.
Taulé, M., M.A. Martí, M. Recasens (2008) 'Ancora: Multilevel Annotated Corpora for Catalan and Spanish', Proceedings of 6th International Conference on Language Resources and Evaluation. Marrakesh (Morocco).
Textos administrativos
Disposiciones, resoluciones y anuncios del Boletín Oficial del Estado publicados entre 2000 y 2021, reutilizados según la licencia tipo de la Agencia Estatal Boletín Oficial del Estado (Resolución de 27 de junio de 2024).
Basado en datos de la Agencia Estatal Boletín Oficial del Estado
Narrativa clásica
Capítulos de novelas y cuentos en español de autores que murieron en 1945 o antes: dominio público en España. Los textos salen de las ediciones digitales de Project Gutenberg.
Textos académicos
CSIC Spanish Corpus 1.0.0, del Barcelona Supercomputing Center dentro del Plan de Tecnologías del Lenguaje (SEDIA, 2022): artículos de las revistas científicas del Consejo Superior de Investigaciones Científicas. Licencia CC BY 4.0.
Críticas de cine
Críticas de usuarios de www.muchocine.net. Licencia CC BY 2.1 ES, según declaran quienes las recogieron:
Cruz, F. L., Troyano, J. A., Enriquez, F., & Ortega, J. (2008). Clasificación de documentos basada en la opinión: experimentos con un corpus de críticas de cine en español. Procesamiento del lenguaje natural, 41.
General
Una mezcla de los cinco corpus anteriores, con el mismo número de textos de cada uno; cada texto conserva la licencia del suyo.
Las fuentes tipográficas
Las dos tienen licencia SIL Open Font License 1.1. Aquí van recortadas a los caracteres latinos y, las del informe en PDF, además, en otro formato.
Literata, la del texto
Copyright 2017 The Literata Project Authors.
Atkinson Hyperlegible Next, la de la interfaz
Copyright 2020-2024 The Atkinson Hyperlegible Next Project Authors.
El código ajeno que llega a tu navegador
El aviso de licencia de cada uno viaja dentro del propio JavaScript.
Ajv
De Evgeny Poberezkin, con licencia MIT. Valida cada paquete de reglas: viaja una función suya y el código que genera para nuestros esquemas.
silabea
De Javier Arce, sobre silabajs, de Nicolás Cofré Méndez, con licencia MIT. Separa las palabras en sílabas para medir la legibilidad.
pdfmake
De bpampuch y liborm85, con licencia MIT, y las piezas que lleva dentro, pdfkit y fontkit entre ellas: 76 en total, cada una con su licencia. Genera el informe en PDF y solo se carga al pulsar «Descargar informe».
Vite
De VoidZero Inc. y sus colaboradores, con licencia MIT. Construye esta web y deja en ella su función para cargar, al pulsar «Descargar informe», el código que genera el PDF.
Rolldown
De VoidZero Inc. y sus colaboradores, con licencia MIT. Es el empaquetador de Vite, y deja en la web sus ayudantes para cargar el código CommonJS de silabea y de pdfmake.
Las listas de frecuencia
wordfreq
De Robyn Speer: las 20.000 palabras más frecuentes del español, con datos de Wikipedia, OpenSubtitles 2018, NewsCrawl, GlobalVoices, Google Books Ngrams, OSCAR, Twitter y Reddit. Licencia CC BY-SA 4.0.
Está en el repositorio para una versión futura: ninguna regla de esta la usa, y no llega a esta web.
La lista completa
THIRD-PARTY-NOTICES.md
Cada pieza con su versión, su huella y el texto entero de su licencia, en el repositorio de RadiografIA.