
India alberga una extraordinaria diversidad lingüística — cientos de idiomas hablados por millones de personas. Sin embargo, a medida que la inteligencia artificial transforma la comunicación, la mayoría de estas lenguas se enfrentan a un desafío fundamental: carecen de datos digitales que la IA necesita para aprenderlas.
Los grandes modelos de lenguaje se entrenan predominantemente con textos de internet, dominados abrumadoramente por el inglés, el mandarín y otras lenguas mayoritarias. Para las lenguas minoritarias de India, esto crea una brecha de visibilidad.
Algunos investigadores ven una oportunidad: creando conjuntos de datos para lenguas indias subrepresentadas, la IA podría convertirse en una herramienta para la preservación lingüística. Sin embargo, los críticos advierten que el poder de decisión sobre la inversión recae en gran medida en las grandes empresas tecnológicas.
Usamos cookies para mejorar tu experiencia. Política de privacidad