
TensorFlow 2.x 模型量化与部署实战:从训练后量化到TFLite优化
引言:为什么需要模型量化 在深度学习模型从研发走向生产的过程中,模型量化(Model Quantization)是一个绕不开的关键环节。随着Transformer、LLM等大模型规模的不断增长,模型的存储体积、推理速度和能耗成为制约落地的核...

引言:为什么需要模型量化 在深度学习模型从研发走向生产的过程中,模型量化(Model Quantization)是一个绕不开的关键环节。随着Transformer、LLM等大模型规模的不断增长,模型的存储体积、推理速度和能耗成为制约落地的核...

引言:为什么需要分布式训练? 随着深度学习模型的规模不断增长,单张GPU卡已经难以满足大多数实际生产场景的训练需求。从BERT(3.4亿参数)到GPT-3(1750亿参数),再到LLaMA系列和最近流行的DeepSeek、Qwen等大语言模...

在TensorFlow 2.x中,Keras提供了高层的 1model.fit() 接口,大多数场景下使用起来非常方便。但当我们需要更精细地控制训练过程时——比如实现梯度裁剪、多优化器交替更新、对抗训练(GAN)或者自定义学习率调度——就需...
YOLO v3 tensorflow inference 报错failed to run cuBLAS routine cublasSgemm_v2: CUBLAS_STATUS_EXECUTION_FAILED的解决办法 环境cuda9....

首先介绍下tensorRT,tensorRT类似于tensorflow serving,都是一种用于将训练好的深度学习模型用于实时inference的工具,区别在于tensorflow serving是以一种server的方式提供出来的也就...

CentOS安装GPU版本的tensorflow serving问题总结 之前安装tensorflow serving一直都是使用的docker镜像的方式,简单快速,但是近来有一台gpu物理机 需要跑一批模型 要求越快越好 担心docker...
java通过gRPC整合tensorflow serving(之三)——使用java调用tfserving的模型 SORRY 本来打算上周末发的,一直有事拖延了一下。 本篇是本系列的第三篇,承接前两篇 【java通过gRPC整合tensor...

java通过gRPC整合tensorflow serving(之二)——安装tfserving并部署示例模型 承接上一篇【java通过gRPC整合tensorflow serving——gRPC java入门例子】 这是本系列的第二篇,上一...
TensorFlow中的decode_jpeg与opencv的imread结果不一致 关于这个问题,我觉得有必要记录一下,开发中可能就是一个小坑。 我遇到的问题是我导出模型部署到了tensorflow serving,然后python编写客...

CentOS解决Docker Networking Disabled: WARNING: IPv4 forwarding is disabled. Networking will not work 由于我的tensorflow servin...