信源与标准 · 入门
arXiv
AI/ML 领域最大的开放预印本平台,是追踪原始研究、训练方法和模型评估的第一入口。
arXiv
AI/ML 领域最大的开放预印本平台,是追踪原始研究、训练方法和模型评估的第一入口。
一、是什么
arXiv 是一个开放获取的预印本(preprint)仓库,覆盖物理、数学、计算机科学、生物学等多个学科。在 AI 领域,它是论文发布最快的核心平台,作者上传后即可被全球研究者阅读和引用。
主要 AI 相关分类:
cs.AI:人工智能cs.CL:计算与语言(NLP)cs.LG:机器学习cs.CV:计算机视觉cs.IR:信息检索
二、为什么存在
arXiv 解决了学术出版的两个瓶颈:
- 速度慢:传统期刊和会议审稿周期长,arXiv 让研究完成后立即公开。
- 访问门槛高:传统论文常被 paywall 阻隔,arXiv 免费开放全文。
对 AI 从业者而言,arXiv 是追新模型、新训练技巧、新基准测试的最快渠道。
三、核心机制
3.1 预印本模式
- 作者上传 PDF 和元数据。
- arXiv 进行基本分类审核,不执行同行评审。
- 读者免费下载、引用、评论。
3.2 版本控制
每篇论文可能有多个版本(v1、v2…),更新会修复错误或补充实验。
3.3 辅助工具
- arXiv Sanity Preserver:按热度/关键词筛选论文。
- Hugging Face Papers:把论文与对应代码、模型关联起来。
四、常见误解
| 误解 | 真相 |
|---|---|
| arXiv 论文都经过同行评审 | 只审核分类合规性,不保证方法正确 |
| arXiv 只面向研究者 | 工程师、产品经理、内容创作者都能从摘要和图表中获得判断 |
| 最新论文一定最好 | 很多创新需要后续验证,热门论文也可能被复现失败 |
| 读 arXiv 必须读完全文 | 先读摘要、结论、图表,再决定是否深入 |
五、怎么用
Level 0:订阅分类
在 https://arxiv.org/list/cs.AI/recent 等分类下查看最新论文标题。
Level 1:使用辅助站点
用 arXiv Sanity 或 Hugging Face Papers 把论文按热度、引用、代码可用性排序。
Level 2:建立个人筛选规则
每月扫一次自己关注领域的标题,只深入 5-10% 的高相关论文。
Level 3:交叉验证
对关键结论,查找是否有后续工作复现、反驳或改进。
六、延伸阅读
- 目录卡:AI研究论文与预印本
- 关联概念:
[[大语言模型]]
代表作品/入口
| 作品 | 说明 | 链接 |
|---|---|---|
| Attention Is All You Need | Transformer 架构奠基论文 | https://arxiv.org/abs/1706.03762 |
| Language Models are Few-Shot Learners | GPT-3 论文 | https://arxiv.org/abs/2005.14165 |
| A Survey of Large Language Models | 大语言模型综述 | https://arxiv.org/abs/2303.18223 |
| arXiv cs.AI 最新论文 | AI 分类日更新入口 | https://arxiv.org/list/cs.AI/recent |
适用场景与行动
场景:需要判断「arXiv」是否适合作为 AI 学习、研究或行业观察信源时。
适合谁:AI 学习者、研究跟踪者、需要追溯一手材料的产品与内容工作者。
下一步:把 arXiv 加入或排除出自己的 AI 信源清单,并在关键判断前交叉验证。
这张卡片由杨思远基于真实工作流和实测经验整理。
如发现信息过时或有误,可通过 /contact 反馈。