上云资讯 - 来上云吧，企业上云一站式服务

2025-06-24 08:32:28 423人关注

阿里云推出自动驾驶模型加速框架PAI-TurboX 训练时间可缩短50%

近日，阿里云正式发布面向自动驾驶领域模型的训练、推理加速框架——PAI-TurboX，旨在提升感知、规划控制乃至世界模型的训推效率。该框架在多个行业模型的训练任务中展现出了显著优势，可缩短高达50%的时间。

阿里云PAI-TurboX 自动驾驶模型训练加速自动驾驶模型推理加速 PAI-TurboX框架优势自动驾驶世界模型训练

2025-03-19 16:14:13 283人关注

大模型长文推理迎来“核弹级”提速！清华APBB框架狂飙10倍，Flash Attention直接被秒

还在为大模型处理长文本“龟速”而抓狂?别急!清华大学祭出“王炸”技术——APB 序列并行推理框架，直接给大模型装上“涡轮增压”引擎!实测显示，这项黑科技在处理超长文本时，速度竟比肩 Flash Attention 快10倍!没错，你没听错，是10倍!

大模型推理加速清华APBB技术大模型性能优化推理速度提升方案大模型技术突破

2025-02-19 10:33:31 801人关注

NVIDIA联合高校发布 “FlashInfer”：提升大语言模型推理效率的全新内核库

随着大语言模型（LLM）在现代人工智能应用中的广泛应用，诸如聊天机器人和代码生成器等工具依赖于这些模型的能力。然而，随之而来的推理过程中的效率问题也日益突出。

NVIDIA FlashInfer LLM推理加速大模型推理优化 GPU加速技术 NVIDIA AI技术

2025-01-28 07:21:34 317人关注

Google AI 提出了扩散模型中推理时间缩放的基本框架

来自纽约大学、麻省理工学院和谷歌的研究团队近日提出了一个创新框架，旨在解决扩散模型在推理时间扩展方面的瓶颈问题。这一突破性研究超越了传统简单增加去噪步骤的方法，为提升生成模型性能开辟了新途径。

Google AI Diffusion模型模型推理推理加速 AI模型优化 Google AI技术应用

2025-01-15 17:21:37 428人关注

苹果研究团队出品！LazyLLM：提高LLM长文本推理效率

最近苹果公司的研究团队和 Meta AI 的研究人员联合推出了一项名为 LazyLLM 的新技术，这项技术在提高大型语言模型（LLM）在长文本推理中的效率。

LLM长文本推理 LazyLLM效率优化大模型推理加速长文本处理技术 LLM性能提升

2025-01-14 12:33:45 276人关注

NVIDIA联手Hugging Face推高效推理服务，AI 模型的Token 处理效率提升五倍

最近，开源平台 Hugging Face 与 NVIDIA 宣布了一项令人振奋的新服务 —— 推理即服务（Inference-as-a-Service），这项服务将由 NVIDIA 的 NIM 技术驱动。新服务的推出可以让开发者们更快速地原型设计，使用 Hugging Face Hub 上提供的开源 AI 模型，并高效地进行部署。

NVIDIA Hugging Face 高效推理模型推理优化 AI推理加速 GPU加速技术

2025-01-10 20:18:18 360人关注

GPU优化新突破！“树注意力”让500万长文本推理提速8倍

在这个信息爆炸的时代，人工智能如同一颗颗璀璨的星辰，照亮了人类智慧的夜空。而在这些星辰中，Transformer架构无疑是最耀眼的那一颗，它以自注意力机制为核心，引领了自然语言处理的新时代。

GPU优化树注意力机制文本推理加速大模型推理优化 GPU计算性能提升

2025-01-08 00:34:17 357人关注

字节跳动开源FLUX Dev的Hyper SD Lora 生图步数减至8步

在AI技术飞速发展的今天，字节跳动的开源动作再次成为行业焦点。FLUX Dev的Hyper SD Lora，以其高效的图片生成能力，将AI绘图推向了一个全新的速度纪元。

字节跳动开源模型 Flux-Dev-Hyper-SD-LoRA 8步超快推理开源AI模型 AI模型推理加速

2025-01-05 13:14:42 464人关注

Llama3天瘦成Mamba！推理速度提升1.5倍

最近，Mamba 团队的研究令人瞩目:来自康奈尔和普林斯顿等高校的研究者们成功将 Llama 这一大型 Transformer 模型 “蒸馏” 成了 Mamba，并设计了一种新型的推理解码算法，显著提高了模型的推理速度。

Llama 3 Mamba 推理速度优化大模型推理加速 LLM性能提升

2024-12-28 15:40:11 301人关注

创新开源框架OpenR 有效提升大模型推理能力

一个名为OpenR的创新开源框架近日问世，旨在解决大型语言模型（LLMs）在复杂推理任务中的短板。这一由伦敦大学学院、利物浦大学、上海交通大学、香港科技大学(广州)和西湖大学研究人员联合开发的框架，通过结合测试时计算、强化学习和过程监督，为提升LLMs的推理能力开辟了新途径。

OpenR框架大模型推理优化大模型推理加速 OpenR框架应用大模型性能提升

- 上云资讯 -

阿里云推出自动驾驶模型加速框架PAI-TurboX 训练时间可缩短50%

大模型长文推理迎来“核弹级”提速！清华APBB框架狂飙10倍，Flash Attention直接被秒

NVIDIA联合高校发布 “FlashInfer”：提升大语言模型推理效率的全新内核库

Google AI 提出了扩散模型中推理时间缩放的基本框架

苹果研究团队出品！LazyLLM：提高LLM长文本推理效率

NVIDIA联手Hugging Face推高效推理服务，AI 模型的Token 处理效率提升五倍

GPU优化新突破！“树注意力”让500万长文本推理提速8倍

字节跳动开源FLUX Dev的Hyper SD Lora 生图步数减至8步

Llama3天瘦成Mamba！推理速度提升1.5倍

创新开源框架OpenR 有效提升大模型推理能力

推荐阅读

上云服务

- 上云资讯 -

阿里云推出自动驾驶模型加速框架PAI-TurboX 训练时间可缩短50%

大模型长文推理迎来“核弹级”提速！清华APBB框架狂飙10倍，Flash Attention直接被秒

​NVIDIA联合高校发布 “FlashInfer”：提升大语言模型推理效率的全新内核库

Google AI 提出了扩散模型中推理时间缩放的基本框架

苹果研究团队出品！LazyLLM：提高LLM长文本推理效率

NVIDIA联手Hugging Face推高效推理服务，AI 模型的Token 处理效率提升五倍

GPU优化新突破！“树注意力”让500万长文本推理提速8倍

字节跳动开源FLUX Dev的Hyper SD Lora 生图步数减至8步

Llama3天瘦成Mamba！推理速度提升1.5倍

创新开源框架OpenR 有效提升大模型推理能力

推荐阅读

上云服务

NVIDIA联合高校发布 “FlashInfer”：提升大语言模型推理效率的全新内核库