点击或拖拽图片到此处上传(最多5张)
ERINE iRAG Edit
Llama-2-7B是由Meta AI研发并开源的、基于优化的Transformer架构、在2T tokens开源数据上训练的7B参数语言模型。
DeepSeek-R1-Distill 模型是在开源模型的基础上通过微调训练得到的,训练过程中使用了由DeepSeek-R1生成的样本数据。
由杭州深度求索人工智能基础技术研究有限公司自研,在数学、代码、自然语言推理等任务上性能表现优异。
DeepSeek-V3,这是一个强大的混合专家(MoE)语言模型,总参数量为671B,采用了创新注意力机制(MLA)和DeepSeekMoE架构,这些架构在DeepSeek-V2中得到了充分验证。此外,DeepSeek-V3开创了一种无辅助损失的负载均衡策略,并设置了多token预测训练目标以获得更强的性能。DeepSeek-V3在14.8万亿个多样且高质量的token上进行预训练,随后通过监督微调和强化学习阶段来充分发挥其能力。