Nemotron-CC是什么?一文让你看懂Nemotron-CC的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

Nemotron-CC概述简介

Nemotron-CC是NVIDIA团队推出的大型预训练数据集,能将Common Crawl数据转化为适用于长序列预训练的高质量语料。Nemotron-CC数据集结合分类器集成、合成数据重述和减少启发式过滤器依赖等方法,实现数据量和质量的更好平衡。Nemotron-CC包含6.3万亿个tokens,其中4.4万亿为全球去重的原始tokens,1.9万亿为合成生成的tokens。Nemotron-CC在短期(1T tokens)和长期(15T tokens)训练中均展现出优越性,特别是在MMLU等任务上,相比DCLM和Llama 3.1模型,Nemotron-CC显著提高了模型的准确性。Nemotron-CC数据集的开发为大型语言大模型的训练提供了更丰富、更多样的数据资源。

Nemotron-CC的功能特色

提供高质量的预训练数据集:Nemotron-CC为大型语言大模型(LLMs)提供高质量、大规模的预训练数据集,特别适用于长序列训练,如15T tokens的训练需求。

平衡数据量和质量:在不显著牺牲数据质量的前提下,大幅增加数据集的规模,包含更多的独特真实tokens,提高模型在长序列训练中的性能。

支持模型性能提升:实验表明,Nemotron-CC训练的模型在多个基准测试任务中表现出色,特别是在MMLU等任务上,相比其他现有数据集,能显著提高模型的准确性。

Nemotron-CC的技术原理

优化文本提取:选用Justext作为HTML-to-text提取器,因其在提取高质量tokens方面表现更佳,有效提升数据集的初始质量。

基于模型的质量标记:

分类器集成:构建三个不同的质量分类器,每个分类器有不同的高质量偏好。基于集成三个分类器,为所有文档打分,根据质量得分将爬取的语料库划分为不同的质量级别。

质量标签分配:进一步将细粒度的质量得分聚类为5个下游任务质量类别,基于连续预训练和任务性能评估,为每个类别分配更符合实际性能的质量标签。

合成数据生成:

低质量数据重述:对于低质量文档,基于重述减少噪声和错误,同时保留有用信息。用Wikipedia风格的提示(prompt)重述低质量文档,有效减少错误和冗余,提高格式化水平。

高质量数据扩展:对于高质量文档,基于生成多样化的问答对、提炼、提取知识和知识列表等方式,获取更多独特的tokens,丰富数据集的内容和多样性。

数据集整合:

大规模数据合成:用Mistral NeMo 12B模型生成超过1.8万亿个合成tokens,其中包括从低质量文档生成的3363亿tokens和从高质量文档生成的1.5万亿tokens。

数据集构建:将上述技术和方法应用于Common Crawl的99个快照(CC-MAIN-2013-20至CC-MAIN-2024-30),构建6.3万亿tokens的数据集,其中4.4万亿为全球去重的原始tokens,1.9万亿为合成生成的tokens。

Nemotron-CC项目介绍

项目官网:https://developer.nvidia.com/blog/announcing-nemotron-cc

arXiv技术论文:https://arxiv.org/pdf/2412.02595

Nemotron-CC能做什么?

预训练大型语言大模型:适用于长序列训练,如15T tokens,提升模型在复杂任务中的性能。

微调和特定任务适应:便于模型在多任务学习和特定领域任务中快速适应,提高任务表现。

文本生成任务:用于生成高质量文本,如新闻、故事,及提升对话系统的自然度。

研究与开发:助力探索模型架构和训练方法的改进,提供基准测试资源。

教育与培训:生成教育资源,辅助语言学习,提升教育内容的丰富性。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • Evined Draw
    Evined Draw Evined Draw是一款创新的绘画应用,它结合了AI技术,为用户带来独特的绘画体验。用户可以每天根据新的主题进行绘画,并通过AI模型生成独特的图像...
  • VisionAgent
    VisionAgent VisionAgent是一个强大的工具,它利用人工智能和大语言模型(LLM)来生成代码,帮助用户快速解决视觉任务。该工具的主要优点是能够自动将复杂的视...
  • Huuk
    Huuk HUUK.AI是一个旅行网站,通过AI技术个性化推荐适合您的冒险路线。它可以根据您的喜好和需求,为您提供旅行路线、景点推荐、交通信息等,让您的旅行更加...
  • BlipCut AI Video Translator
    BlipCut AI Video Translator BlipCut AI视频翻译可以自动将视频准确翻译为英语和其他35种语言。它提供人类般的AI语音和语音克隆功能,无需排队即可实现精确的视频翻译。Bli...
  • Ringle Dingle
    Ringle Dingle RingleDingle是一个提供自定义音乐贺卡服务的网站平台。用户可以自主设计贺卡图像,生成唯一的朗朗上口的歌曲,制作带音乐动画的电子贺卡。无需绘画...
  • tldraw.dev
    tldraw.dev tldraw是一个为React开发者设计的无限画布SDK,它允许开发者在其产品中添加协作白板功能或创造新的基于画布的体验。该SDK包含组件、API和服...
  • vistacreate
    vistacreate VistaCreate是一种免费的图形设计软件,非常适合创建具有易于使用功能,100K+现成模板和简单拖放界面的专业设计。在短短几分钟内创建令人惊叹的...
  • freelogodesign org
    freelogodesign org Freelogodesign.org使您能够使用其AI驱动的徽标和品牌套件生成器快速创建专业徽标和品牌。立即从数千个模板中生成自定义的徽标,或在几分钟...