AI News - Oscar's News

AgenticTwin:集成数字孪生的智能LLM框架用于异常检测

arXiv cs.AI ·

AgenticTwin提出了一个将LLM推理与数字孪生异常检测在信息物理系统中集成的框架,使操作员能够用自然语言提出关于检测到异常的问题。在具有合成异常的真实传感器数据上进行的评估表明,结构化的代理协作和知识基础的推理改进了诊断质量和跨多个场景的异常响应。该工作还验证了在实际信息物理环境中部署轻量级开源LLM的可行性。

FrontierFinance:衡量金融代理前沿智能的具有挑战性的基准

arXiv cs.AI ·

FrontierFinance引入了220个专家精心设计的投资查询基准,涵盖整个投资者工作流程,揭示了工具框架对金融代理性能的影响比模型本身更大。Samaya的内部系统以56%的准确率领先,超过Claude Fable 5(49.2%)成本低2.2倍,而最佳的开源权重模型以4.5倍更低的成本实现近似性能,尽管筛选与发现和宏观分析对所有系统而言仍然是最难的任务。开放基准和评估框架使金融AI代理前沿智能的系统化测量成为可能。

HUGIN:增强自主物流分拣的视觉语言规划

arXiv cs.AI ·

HUGIN引入了一个用于自主物流分拣的视觉语言模型训练框架,通过内生数据增强和全局上下文排序解决跨场景监督稀缺问题。作者构建了SortingBench,一个高质量的工业数据集,并展示了跨开源VLM的显著改进,Qwen3-VL-8B的准确率从63.6%提高到78.8%,通过涉及超过15,000个包的部署测试进行了验证。该工作为大规模自主分拣系统建立了基于VLM的规划的实际可行性。

提高大型语言模型的客观性:利用特征不变安全调优实现跨特征安全行为稳定化

arXiv cs.AI ·

这项工作识别了特征诱发的安全变异现象,其中大型语言模型在不同的系统提示特征下对同一请求表现出不同的安全决策,并提出了特征不变安全调优(TIST)来稳定安全行为。作者引入了表示层级分析,显示特征在低维子空间中扰动安全,并提出特征子空间中立化来在该空间内强制实现不变性。实验证明该方法加强了有害请求拒绝,同时保持了一般能力。

Harness-IF:评估编码代理中跨指令表面的指令遵循

arXiv cs.AI ·

Harness-IF是一个基准,在来自642条规则库的60个现实多轮任务中评估编码代理的指令遵循合规性,并引入了针对先验准确度(AP-Acc)来区分真正的合规性与偶然粘合。在12个前沿模型中,每个模型在反对未提示默认值的规则上的性能下降3.6-7.4个百分点,证明了总体得分高估了真实指令遵循合规性。该基准揭示了已部署代理如何以不同的优先级读取多个指令表面。

J next K prev V open O detail