GPT-6 系列模型选型指南
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何在 GPT-6 各型号间选型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何在 GPT-6 各型号间选型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
MIT 研究者 Alex Zhang 在 Latent Space 播客中介绍了其提出的 Recursive Language Models(RLM),基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的系统,早于 OpenAI 的 Astra。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)为产品获客漏斗做个性化内容选择,七周在线 A/B 测试中,一个人群的漏斗末端转化率取得高个位数百分比相对提升,另一个人群则没有改善,问题出在内容而非模型。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI Ataraxos 以 15 胜 1 负 4 平击败被视为史上最强 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。
TypeSafe AI CEO Diogo Almeida 在 Latent Space 播客中介绍新模型 Jev,称其为面向代码消费的 System 1 模型,按每美元智能而非聊天体验优化。
一位 MIT 研究员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的自主执行与结果分析能力。
一项新研究提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹一分为二、组合两段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。该方法在 goal-conditioned RL 中实现了可扩展的分治价值学习,作者称这是首个将分治价值学习扩展到高复杂度任务的工作。相比 n-step TD,它无需调 n 超参,也不必然带来高方差或次优性。