论文前沿
arXiv 精选 · 顶会论文 · 技术报告 · 共 24+ 条
精选 AI 产品 / 工具点击直达官网
1ARisk of transmission of amyloid β pathology via transfused blood products
✦ AI 摘要该研究探讨了通过输血传播淀粉样β病理的风险,发表于《柳叶刀》。研究可能涉及朊病毒样传播机制,对血液制品安全性和阿尔茨海默病预防有重要启示。内容来自顶级医学期刊,但属于医学领域,与AI从业者直接关联较低。
1ANanoGPT Speedrun Frontier
✦ AI 摘要Prime Intellect发布NanoGPT Speedrun Frontier,展示在单台GPU上以极低成本训练GPT-2级别模型的优化技术。文章详细介绍了训练速度提升的多种策略,包括数据加载、混合精度、内核优化等,并提供了可复现的代码。该研究对资源有限的AI开发者具有重要参考价值,引发社区广泛讨论。
1A[论文] TurboBias 2.0: Streaming Context-Biasing for Production-Efficient ASR Systems
✦ AI 摘要TurboBias 2.0 是一个面向生产环境的 ASR 系统上下文偏置框架,旨在解决流式推理、批量解码、用户特定上下文列表和低运行时开销等实际需求。它扩展了 GPU 加速的 TurboBias,引入不区分大小写的提升图和每流批量解码,使批次中的每个话语都能使用独立的上下文配置,从而实现个性化上下文处理,提升识别准确率并保持高效。
1A[论文] EnSI-RAG: Entity-Structure-Indexed Retrieval-Augmented Generation for Long-Document Question Answering
✦ AI 摘要EnSI-RAG提出一种面向长文档问答的实体结构索引检索增强生成框架。该框架构建与查询无关的实体中心索引,每条记录包含实体、类型、语义类别和值,并保留源文本链接。通过实体级索引和结构信息,EnSI-RAG有效解决传统分块检索中实体与证据分离及多跳推理难题,提升长文档问答性能。
1A[论文] Enhancing LLMs in Predictive Political QA with Semi-Structured Data
✦ AI 摘要该论文针对预测性政治问答任务,指出现有LLM增强方法将外部资源仅视为知识证据,忽略了预测相关信号。作者提出PSL框架,利用半结构化政治记录中的行动者立场和高阶结构信号,通过双视图建模提升预测性能。该研究为LLM在政治预测领域的应用提供了新思路,具有较高的学术价值。
1A[论文] Personalized Privacy Control in LLMs via Attention Head Intervention
✦ AI 摘要本文提出个性化隐私控制概念,针对LLM在代理场景中因用户偏好不同而难以统一隐私边界的问题,引入用户特定披露偏好。作者构建P3Bench基准,扩展上下文隐私策略以包含个性化披露规则。实验表明,基于提示的策略无法可靠执行个性化隐私,如Qwen2.5-7B和Gemma3等模型表现不佳,凸显了注意力头干预方法的必要性。该研究为LLM隐私保护提供了新方向,对AI安全领域具有参考价值。
1A[论文] No PUN Intended: Plausible Unknown Names for Person-Centred LLM Evaluation
✦ AI 摘要本文提出PUN协议,用于构建和验证LLM评估中的“合理未知姓名”,以控制记忆、检索和姓名先验等混淆因素。该协议结合Wikidata组件、网络LLM筛选和受控搜索再验证,并通过204人研究验证,发现被接受的姓名比对照组更像真实姓名,同时参与者重新识别率低。该研究对提升LLM评估的准确性和公平性具有重要价值。
1A[论文] Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems
✦ AI 摘要该论文提出一种用于RAG系统的评估代理,通过NLI事实核查、五信号毒化检测及加权聚合,计算信任指数T=0.4F+0.35C+0.25(1-P),以识别知识中毒和错误信息。在TruthfulQA基准上,使用Llama 3.3 70B达到91%准确率和100%精确率,对指令注入的召回率为100%,有效弥补了RAG系统的安全-可靠性差距。
1A[论文] PromptResponse: Optimizing Prompts for LLM Coding Tasks
✦ AI 摘要该论文研究提示词格式对LLM编码任务的影响。通过构造五种语义相同但格式不同的HumanEval变体(基线、JSON、Markdown、YAML及LLM调优版),让GPT-4o执行8200次实验,发现一致的格式(尤其是JSON)能提升代码生成的效率和语法稳定性。研究为优化编码提示词提供了实证依据。
1A[论文] Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge
✦ AI 摘要本文针对5G及未来6G网络中的故障分析,提出使用LLM进行自由文本评估。现有基准依赖固定答案的MCQ,而本文转向开放式诊断推理,评估三个轻量级LLM(如Claude)在领域知识和故障分析上的表现,并构建LLM-as-Judge框架以规模化验证文本输出。研究发现轻量级模型在深度诊断上存在挑战,为边缘部署AI提供了重要参考。
1A[论文] Target-Aware Calibration Data Selection for Preserving Uncertainty in Quantized Language Models
✦ AI 摘要该论文提出目标感知的校准数据选择方法,以在量化语言模型中保持不确定性行为(如置信度、边界和弃权)。作者将校准数据选择形式化为目标相关的不确定性保持问题,引入分布和边界保持风险,并解释为何单一校准方案无法适配所有部署目标。他们提出轻量级预量化方法DPQ,利用全精度模型指导数据选择,实验表明DPQ在保持不确定性方面优于现有方法,同时维持模型性能。
1A[论文] Extractive Summarization for Arabic Documents Using SAraBERT with a Semantic Siamese Similarity Evaluation Metric
✦ AI 摘要该研究提出SAraBERT,一种增强版AraBERT,通过引入句子间Transformer层用于阿拉伯语抽取式摘要。同时提出语义孪生相似度评估指标,衡量摘要与原文的语义覆盖。实验使用BLEU、ROUGE及该指标验证,结果显示模型有效性,为后续研究提供动力。
1A[论文] TreeWY: Speculative Verification for Gated DeltaNet Hybrids
✦ AI 摘要TreeWY提出了一种针对Gated DeltaNet混合模型的投机验证方法。传统方法需在每个草稿位置保存完整循环状态快照,导致树形草稿内存开销大。TreeWY利用树结构WY变换,通过单次三角求解计算所有草稿节点输出,仅提交时重建接受状态,存储小型伪值矩阵,显著降低内存占用,使宽树高接受率场景可行。
1A[论文] Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs
✦ AI 摘要本文提出量化感知修复(QAH)方法,用于恢复经结构压缩和4比特量化后性能下降的大语言模型。相比默认的量化感知训练(QAT)在硬标签上重新拟合,QAH直接从原始未压缩模型蒸馏4比特学生模型,避免了QAT收敛慢和性能崩塌问题,有效恢复推理、数学、编码和长上下文能力,为部署低成本LLM提供了实用方案。
1A[论文] MentorPulse: Refreshing Cross-Model Latent Guidance for Long-Form Generation
✦ AI 摘要MentorPulse提出一种训练无关的跨模型潜在引导刷新机制,解决长文本生成中静态引导失效的问题。通过压缩导师状态至有界槽记忆,并增量处理新生成token,以门控交叉注意力更新学生读取的记忆,在保持低成本的同时,将4B学生的约束满足度从低于基线2.5分提升至高于基线2.0分,显著改善多轮指令跟随表现。
1A[论文] Source-Free MT Evaluation Is Not MT Evaluation
✦ AI 摘要本文批评了机器翻译评估中普遍使用的无源参考评估方法,认为其不忠实于翻译充分性的定义,且对保留源义但偏离参考的系统不公平。作者主张充分性应参照源文判断,参考仅作为辅助证据,而非主要标准。该论文对MT评估领域具有重要理论价值。
1A[论文] KREL: Automatic Medical Coding via Knowledge-Guided Reasoning over Clinical Evidence with LLMs
✦ AI 摘要本文提出KREL框架,利用大语言模型(LLMs)进行知识引导的临床证据推理,以解决自动医疗编码(AMC)中的挑战。AMC将临床笔记映射为ICD代码,对医疗报销、质量报告和临床研究至关重要。现有方法受限于长文本处理、庞大标签空间和复杂编码规则。KREL通过知识引导推理,提升编码准确性和可解释性,为医疗AI应用提供新思路。
1A[论文] STAR-OPD: Structured Aspect-Cascade-Aware On-Policy Reward Distillation for ABSA Quadruple Extraction
✦ AI 摘要本文针对基于方面的情感分析(ABSA)四元组抽取任务,提出STAR-OPD方法,通过结构化方面级联感知的在策略奖励蒸馏,解决大模型蒸馏至小模型时出现的结构无效状态(如目标-方面绑定断裂、幻觉目标)问题。该方法优于传统离策略蒸馏,能有效提升小模型在细粒度情感抽取上的性能。
1A[论文] Denoising the Future: Context-Aware Spectral Diffusion for Temporal Knowledge Graph Extrapolation
✦ AI 摘要本文提出FreqDiff,一种面向时序知识图谱外推的频率感知扩散框架。针对现有扩散方法在条件聚合时难以区分查询特定证据与非显著历史事实的问题,FreqDiff将未来对象预测建模为查询槽去噪,并设计双流去噪器,结合时序依赖建模与上下文感知频谱校准,自适应合成历史条件滤波器,以增强目标判别信号,提升外推准确性。
1A[论文] Profiling What Matters: Context-Aware Item Profiles from Large-Scale Metadata for LLM Recommenders
✦ AI 摘要本文提出CAIRO框架,针对LLM推荐系统中物品侧信息利用不足的问题,通过结构化元数据和评论,生成用户上下文感知的物品画像,以提升重排序效果。该框架能捕捉决策相关信号,适应不同用户和物品的上下文依赖性,实现个性化细粒度理解,为LLM推荐系统提供新思路。
1A[论文] PSK at WMT 2026 MIST: Task-Specialized QLoRA Adapters for Multilingual Summarization and Question Answering
✦ AI 摘要本文介绍了PSK团队在WMT 2026多语言指令共享任务中的提交系统。该系统基于3.35B参数的Tiny Aya Global模型,为每个任务训练了三个QLoRA适配器,分别用于多语言摘要、基于段落的问答和过滤后的独立问答。实验表明,在保留集上,上下文和摘要适配器优于多任务适配器,而开放问答结果因答案长度和评估方法而异。最终提交了三个系统,共享上下文和摘要适配器,但使用不同的开放问答适配器。
1A[论文] Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol
✦ AI 摘要本文研究LLM智能体在失败后如何修正其成功标准(criterion revision)的问题。作者提出五个非补偿性条件来判定系统是否形成并持续使用新标准K1:标准失败检测、模型提出建议、新回合迁移、对声称载体的干预敏感性以及保持性。在CMB-0.1数据集上,通过12个跨领域案例和四种实验设置(无状态推理、追加历史、模型生成但由框架管理的状态、评估者编写的真实状态)进行评估,共84次确定性评分试验,并使用了四个本地量化模型。该研究为智能体自我修正机制提供了严谨的分析框架。
1A[AINews] How to steal a Reasoning Trace
✦ AI 摘要本文探讨了通过投机解码(Speculative Decoding)技术窃取推理轨迹的方法,揭示了该技术可被用于模型蒸馏,从而获取模型内部推理过程。文章分析了这种攻击方式的原理、潜在风险及防御措施,对AI安全与模型保护具有重要参考价值。
1A联邦学习针对推荐场景化的技术原理解析
✦ AI 摘要本文解析了联邦学习在推荐场景中的技术原理,以微众银行杨强教授在NeurIPS 2019上的演讲为基础,介绍了联邦推荐技术如何应对数据孤岛和隐私保护挑战。文章阐述了推荐系统依赖大量用户数据,但隐私法规限制了数据共享,联邦学习通过分布式训练实现模型优化而不泄露原始数据,并提及FATE这一工业级开源框架。内容聚焦技术落地,对AI从业者理解联邦推荐有参考价值。