逐步实现 https://cnb.cool/trrylab/zhiyu-skill/-/blob/main/zhiyu-quiz-edgeone-plan.md 的前端功能
涉及到后端知识库的参考资料可参考下面这段内容（先不集成 yuanqi skill 的后端）
Install this skill: https://github.com/TencentEdgeOne/edgeone-pages-skills， then deploy to EdgeOne Makers.
``
Q：如何看待高性能SSD在推理时代的应用价值

A：高性能SSD在推理时代的应用价值主要体现在以下几个方面：

1. 加速模型加载与提升性能
模型加载时间优化：SSD的高性能直接影响了AI模型的加载速度。例如，使用Ollama等优化框架可以显著提升模型加载带宽，某些情况下甚至超过了从PCIe Gen3升级到Gen5所带来的硬件性能提升。

首令牌生成时间（TTFT）和每秒令牌数（Tok/s）：在推理过程中，SSD的低延迟和高吞吐量能够显著减少TTFT和提升Tok/s，特别是在多模型切换和RAG（检索增强生成）场景中，系统需要频繁地与磁盘进行数据交换。

2. 满足AI工作负载的特殊需求
随机访问需求：AI推理任务中频繁出现的微小数据随机读取（尤其是小于4KB的随机访问）对SSD的架构提出了新的挑战。传统的SSD优化主要针对4KB或更大的数据块，而AI推理需要更高效的随机访问性能。

高IOPS和低延迟：相比训练阶段的大吞吐量，推理阶段对超小数据块的极低延迟和高IOPS提出了更高要求。SSD需要具备极高的IOPS和低延迟来满足这些需求。

3. 优化内存使用与减少数据交换
内存池化与扩展：CXL技术通过内存池化和扩展，允许系统将内存从CPU解耦，实现多计算单元共享内存资源。这种架构减少了数据在内存和存储之间的交换（这个过程称为页面置换）的频率，从而减少了SSD的写入放大效应（WAF），延长了SSD的使用寿命并降低了维护成本。

近-GPU缓存和分层KV缓存：通过将低效的网络小I/O转化为高效的本地SSD小I/O，可以显著提升AI训练和LLM推理的数据吞吐与响应速度。

4. 提升边缘AI应用性能
降低延迟和提高吞吐量：针对AI边缘设备优化的SSD通过提升性能和耐用性，解决了边缘计算的三大痛点：速度即效率（降低I/O延迟，加速AI推理过程，实现实时决策）、带宽即能力（通过高吞吐量应对边缘端海量的传感器数据并发，保障计算单元的数据供给）和耐用即成本（通过降低写放大，延长硬件寿命，降低长期运维成本并保障业务连续性）。
5. 推动AI存储架构的演进
异构计算与分层存储：在AI集群环境中，数据需要在不同的计算节点之间高效移动。使用不同级别的存储层次（如NAND cache、对象存储层和所有闪存高性能层）可以优化数据访问速度和降低能耗。

QLC技术：QLC技术在不牺牲性能的前提下，提供更高的存储密度和更低的成本，这对于大规模AI部署尤为重要。

6. 软件优化与硬件升级并重
软件优化的关键作用：软件框架的优化程度对性能的影响可能与硬件换代同样重要，甚至更为关键。选择或开发能够充分挖掘硬件潜力的AI运行时框架是实现最佳性能的关键。

系统级优化方法：要实现最快的模型加载速度，必须采取系统性的优化方法，即不仅要采用高性能的SSD，还必须选择或开发能够充分挖掘硬件潜力的AI运行时框架。

7. 未来发展趋势
PCIe Gen5-7与AI存储：随着PCIe Gen5-7标准的普及，AI存储将迎来新的性能飞跃。SSD控制器架构、NAND介质潜力以及功耗散热等全链路优化将共同推动AI存储性能的提升。

NVIDIA Storage-Next与硬件加速：NVIDIA Storage-Next等倡议将推动存储软件栈的重构，硬件加速固件卸载和功耗散热等挑战将为高校研究生和教授在AI存储领域开展创新研究提供新的视角和课题方向。

总之，高性能SSD在推理时代的应用价值不仅在于其高吞吐量和低延迟，更在于其能够通过系统级优化和软件创新，显著提升AI推理的性能和效率。

参考资料：

Micron：多场景推理SSD-带宽/IO表征
Marvell：SSD如何应对极致IO挑战？
KIOXIA：超高IOPS SSD的需求和设计
NVMe 内存语义的实现与价值，为SSD提速续命
Solidigm：NVMe SSD 在AI存储中的价值
Samsung：揭秘SSD单盘扩容的 IU 方案
``
