模型能力
推理与智能体的边界在哪里:哪些能力稳定成立,哪些只是提示词带来的运气。
X · AI RESEARCH LAB · EST. 2026
X 是还没有答案的那一项,AirLab 取自 AI Research Lab。 我们从具体问题出发,做模型、系统与评测,直到结论能被别人独立跑出来。
查看研究方向三条线并行推进,彼此提供约束:能力判断依赖评测,评测依赖可靠的系统。
推理与智能体的边界在哪里:哪些能力稳定成立,哪些只是提示词带来的运气。
工程一侧。服务要能长期运行,实验要能一条命令完整重来。
先把衡量方式定下来。指标讲不清的改进,不计入结论。
研究记录与工程产出会持续补充在这里。
还没有公开的记录。第一篇会很快写出来。
XAirLab 目前规模很小,由少量研究者与工程实践者构成,采取「问题驱动、结果可复现」的工作方式: 先把问题写清楚,再决定投入多少算力与时间。
我们不追求先发声明,只发布自己复现过的结果。未完成的工作会标注为进行中, 结论有边界的地方会写明边界。
研究协作、工程共建与访问学者事宜欢迎来信;也可以留下邮箱,新的研究记录会寄给你。