
印度拥有非凡的语言多样性——数百种语言被数百万人使用。然而随着人工智能重塑传播和信息获取,大多数语言面临根本性挑战:它们缺乏AI学习所需的数字数据。
大型语言模型主要在互联网文本上训练,而互联网内容被英语、普通话和少数其他主要语言所主导。对于印度较小的语言——许多有着丰富的文学传统但网络存在有限——这造成了可见度差距。
一些研究人员看到了机遇:通过为代表性不足的印度语言创建数据集,AI可能成为语言保护的工具。然而批评者警告,决定哪些语言获得投资和数据资源的权力主要掌握在科技巨头手中。
我们使用 cookies 来改善您的体验。 隐私政策