大模型· 2026-10-06#AdaEva#LLM#算法设计#自适应评估#ArXiv
ArXiv发布AdaEva框架:加速大语言模型驱动的算法设计
ArXiv近日发布了一种名为AdaEva的创新框架,旨在加速大语言模型(LLM)驱动的算法设计过程。AdaEva通过自适应部分评估机制,渐进式地在更大实例子集上评估候选算法,并随着…
文 / Mr.Xu0 次阅读0 条讨论与划词
智客 ZICQ 每日整理大模型、开源基础设施与开发者现场的 AI 新闻与深度文章。
投稿技术文章当前筛选: 标签: #边界条件感知 清除筛选
大模型· 2026-10-06#AdaEva#LLM#算法设计#自适应评估#ArXiv
ArXiv近日发布了一种名为AdaEva的创新框架,旨在加速大语言模型(LLM)驱动的算法设计过程。AdaEva通过自适应部分评估机制,渐进式地在更大实例子集上评估候选算法,并随着…
文 / Mr.Xu0 次阅读0 条讨论与划词
前沿论文· 2026-10-06
ArXiv发布了一项关于晶体生成模型的研究,通过引入基于随机插值和离散流匹配的生成模型,并结合群相对策略优化(GRPO)进行强化学习训练,显著提升了目标结构(如亚稳态、独特和新颖结…
Mr.Xu0 次阅读0 条讨论与划词
前沿论文· 2026-10-06
ArXiv发布了一项关于检索中心深度学习(RCDL)的研究,提出了一种新型神经网络架构,通过在训练过程中存储每个数据点的键值对表示,并在推理时通过注意力机制检索和重组这些表示,从而…
Mr.Xu0 次阅读0 条讨论与划词
大模型· 2026-10-06
ArXiv近日发布了一种名为BAT-NO(Boundary-Condition-Aware Transformer Neural Operator)的新型Transformer模型…
Mr.Xu0 次阅读0 条讨论与划词
大模型· 2026-10-06
ArXiv近日发布了一种名为KVE-KD(Key Visual Evidence-guided Knowledge Distillation)的新框架,旨在提升视觉-语言模型在资源…
Mr.Xu0 次阅读0 条讨论与划词
大模型· 2026-10-06
ArXiv发布了一项关于城市共享单车需求预测的研究,提出了一种结合大语言模型(LLM)和时空图卷积网络(ASTGCN)的创新框架。该框架通过语义冲击波机制,将非结构化的城市文本(如…
Mr.Xu0 次阅读0 条讨论与划词
前沿论文· 2026-10-06
ArXiv发布了一项关于神经网络“锯齿状能力”的研究,探讨了模型在处理复杂任务时为何表现出低平均错误率却伴随特定输入失败的现象。研究发现,模型在扩展任务中学习到的知识存在不均匀性:…
Mr.Xu0 次阅读0 条讨论与划词
大模型· 2026-10-06
ArXiv发布了一项关于非对称Actor-Critic方法的研究,提出了一种名为Memory-State Critic的新技术。该方法通过将评论家(Critic)基于策略自身的记忆…
Mr.Xu0 次阅读0 条讨论与划词
前沿论文· 2026-10-06
ArXiv发布了一项关于语言模型输入嵌入机制的研究,探讨了是否需要可训练的输入嵌入表才能实现强大的语言建模能力。研究比较了三种从头训练的解码器语言模型,分别使用可学习的嵌入表、固定…
Mr.Xu0 次阅读0 条讨论与划词
前沿论文· 2026-10-06
ArXiv发布了一项关于语言模型微调过程中遗忘机制的研究,指出优化器记忆是导致模型遗忘先前学习内容的关键因素之一。研究发现,动量优化器在更新过程中会累积历史梯度,这些梯度可能与当前…
Mr.Xu0 次阅读0 条讨论与划词
前沿论文· 2026-10-06
ArXiv发布了一项关于时间序列预测的新研究,提出了一种基于最小二乘法的创新框架。该研究探讨了两种不同的程序:一种通过最小化解码潜在误差进行预测,另一种则通过固定潜在向量维度进行向…
Mr.Xu0 次阅读0 条讨论与划词
大模型· 2026-10-06
ArXiv近日发布了一项关于通用决策模型的研究,提出了名为JEVal的双语基准测试,包含36个数据集的11,257个实例,评估了25种模型配置。研究表明,通用决策模型在基于证据的决…
Mr.Xu0 次阅读0 条讨论与划词