
O Observatorio de Software de Código Aberto da Comisión Europea (OSOR) publicou este verán un novo caso de estudo no que avalía e valora positivamente o proxecto do Estado español para contar coa súa propia intelixencia artificial, unha IA aberta, pública e capaz de falar en varias linguas europeas, entre as que se atopan as co-oficiais do territorio: castelán, galego, catalán e valenciano e éuscaro.
Estamos a falar de ALIA, infraestrutura pública de Intelixencia Artificial de España, unha iniciativa pioneira na Unión Europea que desenvolve modelos de linguaxe abertos, transparentes e de código aberto.
Segundo o OSOR, “trátase da primeira infraestrutura de IA desenvolvida publicamente, aberta e multilingüe de Europa”.
O estudo de caso de ALIA en OSOR detalla que o 90% dos textos de adestramento actuais dos grandes modelos (LLM) están en inglés. ALIA reverte isto integrando linguas coma o galego, catalán ou éuscaro.
Quen está detrás de ALIA
ALIA é a gran aposta tecnolóxica do Goberno de España (promovida por entidades como a Axencia España para a Supervisión da IA, a AESIA, con sede na Coruña, e enmarcada na estratexia España Digital).
Deseñouse especificamente para adestrar grandes modelos fundacionais “coas peculiaridades culturais e lingüísticas do país”.
A través de ALIA Kit, ponse ao dispor da cidadanía un espazo aberto con todos os recursos lingüísticos como modelos de linguaxe e multimodais (texto, voz e imaxe), conxuntos de datos, metodoloxías e documentación.
A coordinación está a cargo do Barcelona Supercomputing Center (BSC-CNS), co liderado da Secretaría de Estado de Dixitalización e Intelixencia Artificial, no marco do Plan Nacional de Tecnoloxías da Linguaxe (ENIA 2024) e do Plan de Recuperación, Transformación e Resiliencia (NextGeneration EU). O seu desenvolvemento apóiase na capacidade de MareNostrum 5, un dos supercomputadores máis potentes do mundo, e conta coa verificación AESIA, o que garante o cumprimento dos estándares de transparencia fixados no Regulamento Europeo de IA.
O proxecto xorde de antecedentes como o Plan de Tecnoloxías da Linguaxe (2019), AINA (Generalitat de Cataluña) e ILENIA (SEDIA), e consolídase como un dos piares da Estratexia Nacional de IntelixenciaAartificial 2024, aliñada coa Década Dixital da Unión Europea.
En canto ás licenzas, os pesos dos modelos, o código de despregamento e os scripts de adestramento de ALIA distribúense baixo licenza Apache 2.0, o que permite o seu uso, modificación e redistribución libremente.
Por que é precisa unha IA diferente
Na actualidade arredor do 90% dos textos empregados para adestrar os grandes modelos de linguaxe (LLM) están en inglés, o que sitúa esta lingua en situación de franca vantaxe e deixa en desvantaxe a outras linguas, feito que é especialmente crítico nun país como España, onde conviven catro linguas cooficiais xunto co castelán.
Dende o portal galego Mancomún salientan que tamén que a maioría destes modelos son de código pechado e desenvólvense fóra de Europa: preto do 80% do uso destas ferramentas corresponde a solucións propietarias, aínda que os modelos abertos xa acadan un 90% do seu rendemento e resultan, de media, ata seis veces máis baratos. “Con este panorama, o Goberno español decidiu apostar por unha alternativa propia, aberta e soberana”, destaca o portal galego.
Os modelos da familia ALIA
Dende Mancomún tamén salientan que o modelo máis coñecido é ALIA-40B, un modelo fundacional multilingüe de 40.000 millóns de parámetros, descrito polo Barcelona Supercomputing Center (BSC) como un dos modelos públicos multilingües máis avanzados de Europa. Foi adestrado cun corpus de máis de 9,37 billóns de tokens en 35 linguas europeas e 92 linguaxes de programación, seguindo unha proporción moi intensiva de datos que lle permite un rendemento moi por riba do que cabería esperar polo seu tamaño.
Tamén se inclúen os modelos Salamandra (unha familia de modelos máis lixeiros, pensados para un despregamento áxil en aplicacións reais, con variantes específicas como SalamandraTA, de tradución, e Salamandra-Guard, para o uso seguro en servizos públicos) e RoBERTa (unha familia de modelos orientada á comprensión da linguaxe e á avaliación, que forma parte dunha liña de traballo máis ampla centrada tamén na creación de corpus e ferramentas de avaliación multilingüe).
ALIA susténtase en corpus textuais de grandes dimensións como o CATalog (cuns 23.000 millóns de tokens) ou o corpus administrativo bilingüe ALIA_DOGV. Todo este volume de datos procésase grazas ao supercomputador MareNostrum 5, situado no Barcelona Supercomputing Center.
A Secretaría de Estado de Dixitalización e Intelixencia Artificial (SEDIA) confirmou que xa hai casos de uso reais en marcha ao abeiro de ALIA, como a iniciativa GobTechLab, que está a identificar preto de 19 casos de uso de alto impacto para o sector público español. Tamén unha ferramenta de Facenda para optimizar os fluxos internos e a atención aos contribuíntes.
Amais están a coller corpo asistentes de IA xerativa para concellos, que axudan á cidadanía co seus trámites e convertendo en accesible a linguaxe burocrática.
