inclusionAI 发布 Llama-3.2-1B-Instruct-singprobe 流式安全探针
inclusionAI 推出 SingProbe,一个基于 meta-llama/Llama-3.2-1B-Instruct 的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,仅增加不到 0.5% 解码开销。
项目更新、模型与开源社区动态
inclusionAI 推出 SingProbe,一个基于 meta-llama/Llama-3.2-1B-Instruct 的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,仅增加不到 0.5% 解码开销。
inclusionAI 发布 SingProbe,一个基于 google/gemma-4-26B-A4B-it 的流式安全探针,复用基座模型隐藏状态逐 token 打分,仅增加不到 0.5% 解码开销。
inclusionAI 在 Hugging Face 发布 SingProbe,一个复用 Qwen3.6-35B-A3B 隐层状态的轻量流式安全探测,逐 token 输出 8 类查询意图、不安全与幻觉风险分数,探测参数仅 4.2M。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-0.6B 之上的流式安全探针,复用基座模型隐藏状态在每个 token 上评估查询意图、回复不安全性和幻觉风险。
inclusionAI 在 Hugging Face 发布 SingProbe,一个构建在 Qwen/Qwen3.5-122B-A10B 上的内在流式安全护栏探针,复用基座模型隐藏状态,在每个 token 上输出 8 类查询意图、回复不安全度和幻觉风险分数,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-0.8B-singprobe,一个基于 Qwen/Qwen3.5-0.8B 隐藏状态的流式安全探针,可在生成过程中逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
inclusionAI 发布基于 Qwen/Qwen3.5-397B-A17B 的流式安全探针 SingProbe,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.8-27B-singprobe,这是一个构建在 Qwen/Qwen3.8-27B 上的内在流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 推出 SingProbe,一个基于 google/gemma-4-E4B-it 的流式安全探针,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复安全性和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-2B-singprobe,这是一个构建在 Qwen/Qwen3.5-2B 上的内在流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-4B-Instruct-2507 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布基于 GLM-5.3 的流式安全探针 GLM-5.3-singprobe,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-4B-singprobe,这是一个构建在 Qwen/Qwen3.5-4B 上的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3.5-9B-singprobe,这是一个构建在 Qwen/Qwen3.5-9B 上的内置流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个基于 google/gemma-4-31B-it 的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 gpt-oss-120b-singprobe,这是构建在 openai/gpt-oss-120b 上的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 stepfun-ai/Step-3.7-Flash 上的内在流式护栏,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布基于 DeepSeek-V4-Flash-0731 的流式安全探针 singprobe,仅 8.13M 参数,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布 Hy3-singprobe,一个构建在 tencent/Hy3 上的流式安全探针,复用基座模型隐藏状态逐 token 打分,解码开销低于 0.5%。
inclusionAI 发布基于 zai-org/GLM-5.2 的流式护栏探针 GLM-5.2-singprobe,仅 12.06M 参数,复用基座模型隐藏状态,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Llama-3.1-8B-Instruct-singprobe,一个基于 meta-llama/Llama-3.1-8B-Instruct 的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布基于 Qwen/Qwen3.5-27B 的流式护栏探针 SingProbe,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 Qwen3-8B-singprobe,这是构建在 Qwen/Qwen3-8B 上的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 gpt-oss-20b-singprobe,这是构建在 openai/gpt-oss-20b 上的流式护栏探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
inclusionAI 发布 SingProbe,一个构建在 MiniMaxAI/MiniMax-M2.7 之上的流式护栏探针,在生成过程中复用基座模型隐藏状态,对每个 token 输出查询意图、回复不安全度和幻觉风险评分。
inclusionAI 在 Hugging Face 发布 SingProbe,这是一个构建在 Qwen3.6-27B 上的流式护栏探针,复用基座模型隐状态在生成过程中对每个 token 打分,覆盖查询意图、响应安全与幻觉风险,解码开销低于 0.5%。
inclusionAI 在 Hugging Face 发布基于 Qwen3.5-35B-A3B 的流式安全探针 SingProbe,探针参数 4.2M,解码时额外开销低于 0.5%。
StepAudio 3 Gen 技术报告发布,该模型在统一框架内支持零样本 TTS、音色设计、人声生成、音效和音乐等多种音频生成任务。其核心是离散自回归生成器,直接对 RVQ token 建模,区别于近期通用音频模型常用的扩散 Transformer 连续生成范式。
Feyospace-v1 论文提出一套数据中心化框架,用 Choulea、SkyReal、Hongzwang、PSBreakup、Kreator 五个系统构建可重置的编码、漏洞、CTF、内核、固件等环境,经执行验证与证据审计后保留 164,269 条轨迹用于长上下文监督微调。
Benchmark Radar 是一个面向 AI 基准与评测的活数据库与搜索引擎,覆盖 LLM 评测、智能体与工具使用、编码、推理、安全及领域评测。系统每日从 37 个来源发现基准论文、仓库、数据集与发布,目录含 1,283 条来源记录和 12,916 条数值观测,并保留来源身份与引用。已发布网页仪表盘、基准排行榜、Pareto 前沿视图、饱和与趋势视图、每日订阅、可下载证据及离线查询 CLI。
针对现有可训练注意力稀疏化方法用硬 Top-K 选择阻断梯度、只能蒸馏逐层稠密注意力分布的问题,研究者提出 SAS(Simple Attention Sparsification),一种门控稀疏注意力机制,将选择器的连续分数以 log 形式注入注意力 softmax,用语言建模损失端到端优化上下文排序。
COBRA-Skills 将 LLM 智能体技能优化建模为动态候选空间上的预算化序列优化,通过上下文赌博机引导的优先级排序与基于证据的技能进化,把评估资源集中到更有潜力的候选上。在六个异构智能体基准和三个目标模型上,该方法平均性能最强,相比 SkillOpt 降低 55–58% 优化成本,每个基准仅用 50 个优化样本。
针对 DPO 假设所有偏好标签可靠的问题,研究者提出 PLC-DPO,利用校准后的策略-参考模型 margin 作为在线证据,将每对样本的训练信号分流为干净、翻转或平局三类,主动校正监督方向与强度。在 57 个数据集-模型-基准组合中,PLC-DPO 对 DPO 的平均胜率达 60.5,优于次优方法的 55.5。该工作为 EMNLP 2026 Findings,代码已开源。
SNAP3D 提出一种物理引导框架,从单张图像生成部件级 3D 资产,解决相邻部件相互穿透、连接无效或受重力坍塌的问题。该方法消除部件间穿透、恢复接触图,并在接触面引入参数化连接件,借助物理仿真反馈优化其位置、朝向与尺寸以提升装配稳定性。实验显示其物理可实现性与稳定性显著优于多个部件级 3D 生成器,并已通过 3D 打印和真实装配验证。
研究者提出 Latent Interface Training(LIT),一种与框架无关的两阶段策略,先在不使用图像的情况下建立以空间目标为条件的动作先验,再通过姿态监督的 latent interface 约束视觉条件路径。
Claude Code 发布 v2.1.270,修复了会话运行一段时间后 Bash 中只读 git 命令意外请求权限的问题,该问题为 2.1.269 引入的回归。
研究构建了一个纯自回归的受控测试平台,在多模态持续预训练中追踪文本、图像、T2I 与 I2T 四类任务的验证损失,以此考察图像 tokenizer 作为"视觉语言"与文本联合建模的效果。
Claude Code v2.1.269 新增 `claude plugin eval`,可对插件运行 eval 套件并输出 JSON 与 HTML 评分报告,同时加入 `/output-style [name]` 用于列出和切换输出样式。
研究者提出一种免训练框架,让具备推理能力的视觉语言模型迭代搜索并推理 Wikipedia,以解决多模态实体链接在稀有实体上的性能退化问题。在覆盖 Hindi、Indonesian、Japanese、Tamil、Vietnamese 五种语言的 MERLIN 基准上,最佳系统整体超越 SOTA 6.9%,稀有实体切片最高提升 23.3%。
研究团队构建了 3.35B 规模的 Tiny Aya L2-Thinker,在覆盖数学、常识推理、指令遵循、开放式生成和文化推理的 6 个基准上,于 60 种语言中实现超过 93% 的 L2 推理率,即模型始终用用户提示词的语言进行推理。