FedSRD Sparsify-Reconstruct-Decompose for北大提出FedSRD:高效联邦大模型微调
第一部分:基本信息 https://arxiv.org/pdf/2510.04601v2 论文标题:FedSRD: Sparsify-Reconstruct-...
第一部分:基本信息 https://arxiv.org/pdf/2510.04601v2 论文标题:FedSRD: Sparsify-Reconstruct-...

一、Kimi-K2.5 核心能力与实战 1. 核心定位与架构 开源 SOTA 多模态模型,官方称 “最强开源编程模型”,万亿 M...
时间线:2024年2月 技术背景:各种\"越狱\"方法出现,Guardrails 技术成熟 我的状态:优...

该文章提出了一种名为TOLERATOR的无训练解码策略,旨在解决离散扩散大型语言模型(dLLMs)解码中“令牌一旦被接受便无法修改”的核心问题,通过两阶段流程提...

📖标题:LogicReward: Incentivizing LLM Reasoning via Step-Wise Logica...

目的 为避免一学就会、一用就废,这里做下笔记 模型文件夹说明 以魔塔社区中Qwen2.5-VL-7B-Instruct-bnb-4bit为例...

大模型在当今人工智能领域占据着核心地位,其强大的能力正不断推动各行业的变革与创新。无论是对人工智能充满好奇的初学者,还是希望在该领域...
AI技术普及当下,大模型已成为企业数字化转型、开发者创新的核心支撑。但多模型选型繁琐、接口开发复杂、算力成本偏高、部署门槛较高等问题,...
大模型多维度能力评估与幻觉定量评测实战(基于MMLU/BBH评测集) 文档概述 文章核心价值系统掌握大模型多维度能力评测体系...

下一状态预测 (NSP,Next State Prediction) 是从 大语言模型 (LLM) 向 世界模型 (World Model) 进化...