大模型· 2026-10-10
arXiv发布自演进LLM智能体:基于合规约束的运行时进化机制
arXiv发布了一项关于自演进LLM智能体的研究,提出了一种基于运行时合规约束的进化机制。该方法通过限制模型权重的固定性,将智能体的自演进过程限定在运行时工具调用逻辑、指令文本和基…
智客 ZICQ 每日整理大模型、开源基础设施与开发者现场的 AI 新闻与深度文章。
投稿技术文章大模型· 2026-10-10
arXiv发布了一项关于自演进LLM智能体的研究,提出了一种基于运行时合规约束的进化机制。该方法通过限制模型权重的固定性,将智能体的自演进过程限定在运行时工具调用逻辑、指令文本和基…
大模型· 2026-10-10
arXiv发布了一项关于可解释的表头中心框架的研究,该框架旨在解决仅依赖元数据的语义表格解读(STI)和数据质量评估(DQA)问题。该框架通过将表头映射到39种可解释的FinalF…
大模型· 2026-10-09
OpenAI推出GPT-6.1 Sol版本,通过与Asana合作,在浏览器智能体应用中实现了显著的性能提升和成本优化。测试结果显示,GPT-6.1 Sol将模型成本降低了76倍,同…
大模型· 2026-10-09
AWS在2026年9月对其AI开发工具平台进行了重大更新,包括Amazon Bedrock、AgentCore和Strands。Amazon Bedrock扩展了对前沿模型的支持,…
大模型· 2026-10-09
arXiv发布了一项关于AI长时记忆的研究成果,推出了名为Galahad-KV的开源工具包。该工具包通过将大语言模型的键值(KV)状态保存到本地NVMe磁盘中,并在后续推理中直接加…
智能体· 2026-10-10
本研究探讨了小型大语言模型(LLM)智能体在明确的时间预算下能否高效运行,并评估了Qwen3.6-27B和Qwen3-4B在多个基准测试中的表现。研究发现,仅通过提示提供时间预算,…
智能体· 2026-10-10
arXiv发布了一项关于工具智能体可控遗忘技术的研究,通过智能选择并压缩工具执行结果,显著降低了API调用成本和输入token使用量。该方法在保持任务行为一致性的同时,展示了在噪声…
智能体· 2026-10-09
LangChain宣布在其开源软件工程工具包中集成了一款模型路由器,该技术通过智能任务分配机制,将编程任务的平均成本降低了64%,同时保持了任务质量无明显下降。这一创新为开发者提供…
智能体· 2026-10-09
LangChain宣布在其开源软件工程(Open SWE)工具包中集成了一个模型路由器,该路由器能够将编程任务的平均成本降低64%,同时保持任务质量无明显下降。该模型路由器通过智能…
智能体· 2026-10-09
Postman与AWS合作推出Agent Mode,这是一款基于Amazon Bedrock的AI原生工作流解决方案,旨在帮助开发者更高效地完成API测试、文档生成、发现和实现等任…
开源AI· 2026-10-08
Anthropic推出了一款名为OSS Scanner的免费AI安全扫描服务,旨在帮助开源项目识别和修复安全漏洞。该服务通过Anthropic最强大的AI模型对开源项目进行定期、彻…
开源AI· 2026-10-08
CoDR(Confidence Drift Remasking)是一种无需训练且与采样器无关的改进方法,旨在解决掩码扩散语言模型(MDLMs)中由于置信度漂移导致的推理错误问题。该…
开源AI· 2026-10-07
微软亚洲研究院发布了一款名为Agent Lightning v1.0的轻量级智能体强化学习(RL)框架,旨在简化AI智能体的训练流程。该框架通过与实际部署的智能体工具链无缝集成,消…
开源AI· 2026-10-07
Hugging Face推出了名为SGAnalog的开源模拟电路设计基准测试集,旨在解决现有基准测试中模型是否真正学习到可迁移电路设计技能以及输出是否适用于实际工艺和测试条件的问题…
开源AI· 2026-10-07
Hugging Face推出了一种名为Zero-Shot Visualization (ZSV)的新系统,用于通过自然语言用户提示将文本语料库映射到相应的概念轴上进行可视化。该系统…
算力架构· 2026-10-09
Hugging Face推出了一种针对GPU集群的高效调度技术,旨在优化AI计算资源的分配与管理。该技术通过智能化的任务调度策略和资源分配机制,显著提升了GPU集群的利用率和整体计…
算力架构· 2026-10-01
NVIDIA推出AI工厂概念,强调通过优化AI硬件的生产力、耐用性和通用性来最大化投资回报率。AI工厂以每兆瓦60万美元的成本构建,通过提升每秒每兆瓦的吞吐量、延长硬件使用寿命以及…
算力架构· 2026-09-17
Crusoe宣布完成39亿美元融资,用于建设大规模数据中心和模块化AI工厂。此轮融资后,Crusoe估值达到309亿美元,展现了AI领域对强大计算资源的需求增长。此举不仅将提升AI…
算力架构· 2026-09-17
Crusoe 宣布完成 39 亿美元融资,用于建设大规模数据中心和模块化 AI 工厂,推动 AI 基础设施的规模化发展。此轮融资后,Crusoe 的估值达到 309 亿美元,展现了…
算力架构· 2026-09-17
华为正加速推出其下一代AI芯片Ascend 960DT,旨在缩小中国与美国在AI计算领域的差距,并直接与英伟达展开竞争。该芯片的发布计划表明华为在AI硬件领域的战略布局正逐步深化,…
前沿论文· 2026-10-10
arXiv发布了一篇关于智能体AI系统自改进与验证机制的研究论文。该研究提出了一种基于有界验证和隐藏随机性的框架,用于区分智能体AI在搜索时间、支持增强和输出验证机制上的改进方式。…
前沿论文· 2026-10-10
arXiv发布了一篇关于以人为中心的人工智能(AI)的研究论文,强调了在AI系统中理解和建模人类解释多样性的重要性。论文指出,传统AI系统通常假设存在单一明确的真实答案,而忽略了人…
前沿论文· 2026-10-09
本文深入探讨了人工智能拒绝机制的技术原理、现状与挑战。随着AI模型被训练得越来越智能,它们也被赋予了拒绝执行有害请求的能力。然而,这种能力并非完美无缺,其背后的技术依赖于复杂的概率…
前沿论文· 2026-10-09
arXiv发布了一篇关于以人为本AI的重要研究论文,强调了理解人类解释在AI系统开发中的关键作用。论文指出,传统AI系统通常假设单一确定的真实存在,而忽略了人类解释的内在模糊性。通…
前沿论文· 2026-10-09
arXiv发布了一项关于Agentic AI系统验证与自改进的研究,提出了一个形式化框架,用于分析智能体在搜索、支持获取和输出验证机制方面的改进策略。该框架通过隐藏终端随机性和交替…
行业动态· 2026-10-09
Sophos宣布与OpenAI合作,利用其Daybreak技术将网络威胁调查时间缩短96%,并实现了52%的MDR(托管检测与响应)案例自动化,同时保持人工监督。这一合作展示了AI…
行业动态· 2026-10-09
美国威斯康星州交通部(WisDOT)推出了一款基于大语言模型(LLM)的交通管理计划(TMP)生成系统。该系统通过微调多个开源LLM,并结合WisDOT的WisTMP系统,实现了交…
行业动态· 2026-10-08
OpenAI宣布其Codex模型的使用成本大幅降低,LegalOn通过优化任务分配和预算管理,将每日Codex成本降低了65%,同时保持了开发速度。这一举措展示了AI技术在提升效率…
行业动态· 2026-10-08
Anthropic 宣布启动一项名为“Anthropic 网络安全使命”的长期计划,旨在构建安全、可靠且可解释的AI系统。该计划体现了 Anthropic 对 AI 安全领域的持续…
行业动态· 2026-10-08
USA Today及其旗下多家地方报纸对OpenAI提起诉讼,指控其未经授权复制数十万篇文章用于训练AI模型,并要求超过2.5亿美元的赔偿。这一诉讼是OpenAI近期面临的一系列版…
安全与隐私· 2026-08-10
Checkpoint Research发布了一篇关于Cloudflare代码模式及其Workers功能的研究报告,揭示了这些工具在处理复杂任务时可能存在的安全漏洞。研究指出,攻击者…