锁在互联网墙里的中国大模型,国产AI突围之路还有多远
乌鸦小编 发表于:2026-6-13 01:13 复制链接 发表新帖
阅读数:82
2026年6月,知名科技媒体The Information发表了一篇题为“Why China's AI Models Stay Behind the Great Firewall”的深度报道,指出尽管中国AI大模型在技术和用户规模上取得了巨大进步,但由于互联网生态的相对封闭性,中国大模型在全球数据获取和开源生态参与方面面临结构性制约。这篇报道在中国AI圈引发了广泛讨论,也让“锁在互联网里的中国大模型”成为了一个无法回避的行业命题。报道中引用的一个数据格外刺痛中国AI从业者的神经:在全球Top 100的开源大模型项目中,由中国团队主导的项目虽然数量可观,但海外贡献者参与度排名前50的项目中,中国项目仅占4个。

从数据层面来看,这个命题并非空穴来风。全球互联网的公开网页中,中文内容占比约为1.3%,而英文内容占比超过58%。全球代码托管平台GitHub上,以中文为主要文档语言的仓库占比不足3%。全球顶级AI学术论文中,90%以上以英文发表。这意味着,一个主要依赖中文互联网数据训练的大模型,在训练语料的广度和深度上天然处于劣势。更关键的是,许多高质量的英文技术文档、学术论文和开源代码讨论,由于网络访问限制,中国的研究者和工程师无法实时获取和参与。

但技术层面的突围路径并非完全封死。DeepSeek团队在2026年初公开的技术报告中展示了一种创新的训练方法:通过高质量翻译和跨语言对齐技术,将英文互联网上的优质语料高效地转化为中文模型的训练数据,同时利用合成数据生成技术弥补特定领域的数据缺口。这种方法在数学推理和编程任务上取得了显著成效——DeepSeek最新模型在GSM8K数学基准上的得分已达96.8%,超过了同期的GPT-5。此外,字节跳动和阿里巴巴也各自开发了基于对比学习的跨语言预训练框架,在中文到英文的知识迁移效率上取得了重要突破。

生态层面的突围同样至关重要。2026年第一季度,由中国企业和开发者主导的开源大模型项目数量同比增长了180%。阿里开源的通义千问-72B模型在全球最大开源模型社区HuggingFace上的下载量已突破1,200万次,在海外开发者中的使用率持续攀升。百度飞桨和华为昇思等国产深度学习框架的海外用户数合计超过800万。开源正在成为中国AI企业打破生态壁垒、参与全球AI治理的重要路径。通过开源,中国大模型不仅可以获得全球开发者的反馈和贡献,还能在事实上参与国际AI标准的制定。

不过,过于乐观的叙事同样需要警惕。开源能够解决技术扩散的问题,但解决不了基础科学研究的差距。在Transformer之后的下一代AI架构创新方面,中国学术界和产业界的原创性贡献仍然有限。芯片和算力的硬约束短期内很难突破。中国AI的突围之路需要的是在基础研究、工程能力和生态建设三个维度上的长期投入,而非一场可以速战速决的战役。对于行业观察者而言,关注的不应只是融资额和参数量的数字游戏,而是中国AI企业能否在底层创新上实现从“跟随”到“引领”的真正跨越。
本页内容由网友自行在乌鸦部落发布,本站仅提供帖文、图片存储空间服务,帖文(图片)发布者应自行负责所上传帖文(图片)涉及的法律责任,本站对帖文真实性、版权等概不负责,亦不承担任何法律责任。
条评论
您需要登录后才可以回帖 登录 | 立即注册
高级
相关推荐

关闭

乌鸦部落