LLM in Pytorch - 搜索 News

Karpathy 再次语出惊人：LLM 时代，PyTorch 之流的软件抽象都将成为历史

llm.c 是 Karpathy 用 C 语言（外加一点点 C++）从零开始写的一个 Transformer 训练框架为什么要写 llm.c？事情是这样的：一年前，Karpathy 想在他的视频系列（Karpathy非常喜欢分享AI技术）中添加一个关于 LLM 训练的视频，于是他开始用 PyTorch 写代码。结果，他被 PyTorch ...

9 天

DeepSeek倒逼vLLM升级！芯片内卷、MoE横扫千模，vLLM核心维护者独家回应 ...

DeepSeek 的复杂性反而为团队带来了优化与泛化的契机。Michael 指出，团队将原本主要用于 DeepSeek 私有环境的技术，转化为可持续、通用化的实现，使其能服务更多基于 MoE 架构的模型。他强调，vLLM 的某些演进正是受 ...

新浪网

Arm KleidiAI 助力提升 PyTorch 上 LLM 推理性能

生成式人工智能 (AI) 正在科技领域发挥关键作用，许多企业已经开始将大语言模型集成到云端和边缘侧的应用中。生成式 AI 的引入也使得许多框架和库得以发展。其中，PyTorch 作为热门的深度学习框架尤为突出，许多企业均会选择其作为开发 AI 应用的库。

7月

Meta「轻量级」KernelLLM颠覆GPU内核生成，8B参数碾压GPT-4o

【导读】Meta推出KernelLLM，这个基于Llama 3.1微调的8B模型，竟能将PyTorch代码自动转换为高效Triton GPU内核。实测数据显示，它的单次推理性能超越GPT-4o和DeepSeek V3，多次生成时得分飙升。

新浪网

PyTorch官宣：告别CUDA，GPU推理迎来Triton加速新时代

【新智元导读】用英伟达的GPU，但可以不用CUDA？PyTorch官宣，借助OpenAI开发的Triton语言编写内核来加速LLM推理，可以实现和CUDA类似甚至更佳的性能。试问，有多少机器学习小白曾被深度学习框架和CUDA的兼容问题所困扰？又有多少开发者曾因为频频闪烁的警报「 ...

来自MSN

PyTorch 2.8发布：LLM推理性能大幅提升，Intel GPU分布式后端实验性支持上线

PyTorch，这一广受欢迎的开源机器学习框架，近期正式推出了其最新版本——2.8版。此次版本更新聚焦于提升量化大语言模型（LLM）在Intel CPU上的推理性能，吸引了众多开发者和研究人员的目光。在PyTorch 2.8中，开发者团队通过算法优化和技术革新，显著提高了 ...

一些您可能无法访问的结果已被隐去。

显示无法访问的结果