新闻

谷歌被曝要把Gemini“写进”芯片?推理能效最高提升10倍

1 分钟阅读
来源:zhidx.com
智东西 编译 | 茄子 编辑 | 程茜 智东西7月21日消息,昨日,The Information援引知情人士消息报道,谷歌正在研发一款面向 Gemini 模型的新型AI服务器 芯片Frozen v2 。该芯片计划将Gemini模型部分架构直接集成到芯片中,通过减少运行过程中的计算决策和数据搬运, 提升AI推理效率 。 知情人士透露,谷歌工程师预估,按照单位功耗能够输出的Token数量计算,Frozen v2的效率可能达到谷歌最新自研AI芯片的 6至10倍 。 这款芯片在谷歌内部被非正式地称为“Frozen v2”。知情人士称,谷歌希望借此缓解严重的AI算力短缺问题。算力紧张已经在谷歌内部引发矛盾,还迫使谷歌云拒绝部分外部客户的订单。 知情人士还透露,谷歌最快可能于2028年部署这款芯片,但该公司目前仍在确定Frozen v2的主要功能、各部分的协同方式,以及究竟要将多少模型信息固化在芯片中。 The Information还提到,Frozen v2并非谷歌首次探索模型专用芯片。此前,谷歌DeepMind首席科学家杰夫·迪恩(Jeff Dean)曾计划将模型权重直接固化到芯片中,但由于该方案的芯片只能适配特定版本模型、生命周期过短,最终被搁置。 一、把Gemini部分逻辑写入芯片,减少芯片数据搬运 当前主流AI芯片大多强调通用性和可编程能力,如英伟达GPU能够支持多种AI模型和计算任务。这类芯片需要支持多种不同AI模型,因此在运行过程中需要根据模型需求完成大量计算调度和决策。谷歌TPU也类似,虽然它针对AI进行了优化,但也需要兼顾不同模型运行需求。 而Frozen v2采用了不