信源与标准 · 入门

arXiv

杨思远 / 思行致远 · 2026/7/7 · 置信度:高
arXiv预印本论文AI研究信源

AI/ML 领域最大的开放预印本平台,是追踪原始研究、训练方法和模型评估的第一入口。

arXiv

AI/ML 领域最大的开放预印本平台,是追踪原始研究、训练方法和模型评估的第一入口。


一、是什么

arXiv 是一个开放获取的预印本(preprint)仓库,覆盖物理、数学、计算机科学、生物学等多个学科。在 AI 领域,它是论文发布最快的核心平台,作者上传后即可被全球研究者阅读和引用。

主要 AI 相关分类:

  • cs.AI:人工智能
  • cs.CL:计算与语言(NLP)
  • cs.LG:机器学习
  • cs.CV:计算机视觉
  • cs.IR:信息检索

二、为什么存在

arXiv 解决了学术出版的两个瓶颈:

  1. 速度慢:传统期刊和会议审稿周期长,arXiv 让研究完成后立即公开。
  2. 访问门槛高:传统论文常被 paywall 阻隔,arXiv 免费开放全文。

对 AI 从业者而言,arXiv 是追新模型、新训练技巧、新基准测试的最快渠道。

三、核心机制

3.1 预印本模式

  • 作者上传 PDF 和元数据。
  • arXiv 进行基本分类审核,不执行同行评审
  • 读者免费下载、引用、评论。

3.2 版本控制

每篇论文可能有多个版本(v1、v2…),更新会修复错误或补充实验。

3.3 辅助工具

  • arXiv Sanity Preserver:按热度/关键词筛选论文。
  • Hugging Face Papers:把论文与对应代码、模型关联起来。

四、常见误解

误解真相
arXiv 论文都经过同行评审只审核分类合规性,不保证方法正确
arXiv 只面向研究者工程师、产品经理、内容创作者都能从摘要和图表中获得判断
最新论文一定最好很多创新需要后续验证,热门论文也可能被复现失败
读 arXiv 必须读完全文先读摘要、结论、图表,再决定是否深入

五、怎么用

Level 0:订阅分类

https://arxiv.org/list/cs.AI/recent 等分类下查看最新论文标题。

Level 1:使用辅助站点

用 arXiv Sanity 或 Hugging Face Papers 把论文按热度、引用、代码可用性排序。

Level 2:建立个人筛选规则

每月扫一次自己关注领域的标题,只深入 5-10% 的高相关论文。

Level 3:交叉验证

对关键结论,查找是否有后续工作复现、反驳或改进。

六、延伸阅读

代表作品/入口

作品说明链接
Attention Is All You NeedTransformer 架构奠基论文https://arxiv.org/abs/1706.03762
Language Models are Few-Shot LearnersGPT-3 论文https://arxiv.org/abs/2005.14165
A Survey of Large Language Models大语言模型综述https://arxiv.org/abs/2303.18223
arXiv cs.AI 最新论文AI 分类日更新入口https://arxiv.org/list/cs.AI/recent

适用场景与行动

场景:需要判断「arXiv」是否适合作为 AI 学习、研究或行业观察信源时。

适合谁:AI 学习者、研究跟踪者、需要追溯一手材料的产品与内容工作者。

下一步:把 arXiv 加入或排除出自己的 AI 信源清单,并在关键判断前交叉验证。

这张卡片由杨思远基于真实工作流和实测经验整理。

如发现信息过时或有误,可通过 /contact 反馈。