arXiv发布关于智能体技能下游效用实证研究:揭示技能组织与任务性能关系
arXiv发布了一项关于智能体技能(Agent Skills)下游效用的实证研究,重点探讨了技能内容、执行配置和多技能组织如何影响任务性能。研究基于87个SkillsBench任务…
智客 ZICQ 每日整理大模型、开源基础设施与开发者现场的 AI 新闻与深度文章。
投稿技术文章当前筛选: 标签: #AI Services 清除筛选
arXiv发布了一项关于智能体技能(Agent Skills)下游效用的实证研究,重点探讨了技能内容、执行配置和多技能组织如何影响任务性能。研究基于87个SkillsBench任务…
前沿论文· 2026-10-08
arXiv发布了一项关于语言距离量化的研究,扩展了其之前提出的QuanLing框架至西方罗曼语系(法语、葡萄牙语、西班牙语、意大利语)。该研究通过计算LaBSE句子嵌入距离、BER…
前沿论文· 2026-10-08
arXiv发布了一项关于自杀风险评估的研究,提出了一种结合风险预测、证据验证和心理因素识别的综合框架。该框架通过长度路由处理不同长度的社交媒体帖子,并利用风险-证据约束确保预测一致…
大模型· 2026-10-08
arXiv发布了一项关于大语言模型(LLM)‘逢迎行为’(Sycophancy)的研究,揭示了模型在面对用户质疑时放弃正确答案或迎合用户立场的现象。研究通过分析103,939条标注…
大模型· 2026-10-08
arXiv发布了一项关于假新闻检测的新研究,提出了一种名为Gated Cross Attention (GCA)的框架,用于解决新闻在保留事实基础上被不同情感重写而影响检测模型鲁棒…
前沿论文· 2026-10-08
arXiv发布了一项关于贝叶斯镜像架构(BMA)的研究,这是一种自指生成框架,通过循环递归实现感官抽象、元抽象与自潜态的交互。该架构的核心在于一个封闭的更新机制,将混合事件-自潜态…
前沿论文· 2026-10-08
一项针对流式说话人分离器小数据适应过程的研究揭示了检测准确性与身份一致性之间的权衡问题。研究发现,尽管小数据适应显著提升了领域内说话人分离性能并可迁移到独立语料库,但这种提升在不同…
智能体· 2026-10-08
Humanize是一种新型的多智能体协作工作流,旨在解决智能体编程中代码生成与可靠完成之间的矛盾。其核心机制围绕“判断工程”展开,通过明确划分规划、实现、审查和学习等阶段,并引入7…
前沿论文· 2026-10-08
Route-Verify-Vote (RVV) 是一种针对混合领域推理的全新框架,通过领域条件自一致性推理提升模型在复杂场景下的推理能力。该框架无需对语言模型进行参数更新,而是通过…
大模型· 2026-10-08
Hugging Face推出了一种名为GradSAT的新型SMT求解器框架,通过引入多任务学习(MTL)和动态梯度归一化(GradNorm),解决了传统基于优化的SMT求解器中梯度…
开源AI· 2026-10-08
CoDR(Confidence Drift Remasking)是一种无需训练且与采样器无关的改进方法,旨在解决掩码扩散语言模型(MDLMs)中由于置信度漂移导致的推理错误问题。该…
大模型· 2026-10-08
Hugging Face推出了一种名为Emo-Jev的新型无训练情感分类框架。该框架采用两种互补实现方式:Emo-Jev-D通过分解任务为原子判断并组合概率生成最终预测;Emo-J…