速报:Flock新规则、克隆未来与儿童细胞 →
警用科技公司Flock因日益增长的监视隐忧,正在改变警官访问其全国车牌识别网络的方式。该声明反映了对警察监视基础设施和数据访问做法的更广泛审视。
警用科技公司Flock因日益增长的监视隐忧,正在改变警官访问其全国车牌识别网络的方式。该声明反映了对警察监视基础设施和数据访问做法的更广泛审视。
科学家Deanne Taylor在发现现有细胞研究存在重大空白后,领导了一项绘制童年发展细胞地图的工作。她的研究以《人类细胞图谱》项目为基础,填补人类生物学研究中以前的空白。
拥有二十年专属体验设计经验的奢侈生活方式专家Roman Chiporukha正在开创太空旅行代理这一新职位。他在组织高端假期和定制项目方面的背景使他能够引领商业太空旅游的发展。
科学家开发了一种CRISPR技术,可从雄性小鼠胚胎中移除Y染色体,创造出与雄性在遗传上完全相同的雌性克隆。这一突破展示了在物种保护中的潜在应用,同时引发了关于人类克隆滥用的伦理担忧。
AgenticTwin提出了一个将LLM推理与数字孪生异常检测在信息物理系统中集成的框架,使操作员能够用自然语言提出关于检测到异常的问题。在具有合成异常的真实传感器数据上进行的评估表明,结构化的代理协作和知识基础的推理改进了诊断质量和跨多个场景的异常响应。该工作还验证了在实际信息物理环境中部署轻量级开源LLM的可行性。
FrontierFinance引入了220个专家精心设计的投资查询基准,涵盖整个投资者工作流程,揭示了工具框架对金融代理性能的影响比模型本身更大。Samaya的内部系统以56%的准确率领先,超过Claude Fable 5(49.2%)成本低2.2倍,而最佳的开源权重模型以4.5倍更低的成本实现近似性能,尽管筛选与发现和宏观分析对所有系统而言仍然是最难的任务。开放基准和评估框架使金融AI代理前沿智能的系统化测量成为可能。
HUGIN引入了一个用于自主物流分拣的视觉语言模型训练框架,通过内生数据增强和全局上下文排序解决跨场景监督稀缺问题。作者构建了SortingBench,一个高质量的工业数据集,并展示了跨开源VLM的显著改进,Qwen3-VL-8B的准确率从63.6%提高到78.8%,通过涉及超过15,000个包的部署测试进行了验证。该工作为大规模自主分拣系统建立了基于VLM的规划的实际可行性。
这项工作识别了特征诱发的安全变异现象,其中大型语言模型在不同的系统提示特征下对同一请求表现出不同的安全决策,并提出了特征不变安全调优(TIST)来稳定安全行为。作者引入了表示层级分析,显示特征在低维子空间中扰动安全,并提出特征子空间中立化来在该空间内强制实现不变性。实验证明该方法加强了有害请求拒绝,同时保持了一般能力。
本文将比例类比框架——即A与B的关系如同C与D的关系——从布尔和实值域扩展到概率分布,利用贝叶斯更新实现。作者在标准指数族分布上研究了这一数学框架,并通过高斯混合近似展示了对任意分布的扩展。该工作为概率类比推理建立了形式化基础。
Harness-IF是一个基准,在来自642条规则库的60个现实多轮任务中评估编码代理的指令遵循合规性,并引入了针对先验准确度(AP-Acc)来区分真正的合规性与偶然粘合。在12个前沿模型中,每个模型在反对未提示默认值的规则上的性能下降3.6-7.4个百分点,证明了总体得分高估了真实指令遵循合规性。该基准揭示了已部署代理如何以不同的优先级读取多个指令表面。