延迟物化
2022/9/16 23:19:42
本文主要是介绍延迟物化,对大家解决编程问题具有一定的参考价值,需要的程序猿们随着小编来一起学习吧!
物化我的理解就是获取某一个结果(或是这中间结果)
比如我有一个表 table: k1,k2,v1,v2,v3
如果我执行一个简单的SQL
select k1,k2 from table
如果我们的数据存储格式是按列组织的(列存),那么我们只需要物化k1,k2 (只需要扫描k1,k2所在的列),而v1,v2,v3在这个查询中不需要物化(这样可以减少大量的IO)
延迟物化:
延迟物化就是尽可能推迟物化的阶段
比如这样的一个SQL
select sum(v1), sum(v2), sum(v3) from table where k1 < 1000 and k2 < 2000;
在不考虑索引的前提下,如果不进行延迟物化,那我们就需要把k1,k2,v1,v2,v3 所有的数据都读取出来,然后从里面筛选出来想要的列。
但是如果我们最终结果集不是很多,而计算的列特别多,这个时候我们会扫描大量的数据。
对于这种情况。延迟物化是这一类case解决思路
我们不需要扫描所有的数据,我们可以只扫描 k1 < 1000 and k2 < 2000
的数据
在没有索引加速的情况下,我们可以先把 k1和k2这两列扫描出来另外,然后我们通过k1 k2的行号把剩余的其他列扫描出来。
除了filter之外,其实很多算子也是可以用延迟物化加速的。例如order by limit
select * from table order by k1 limit 10;
这个查询可能会扫描大量的数据,然后再做一个order by
但是这个查询的结果集只有10行。而且order by的一列,因此这个query我们可以这样改写:
select * from table where k1 in (select k1 from table order by k1 limit 10) order by k1 limit 10;
这篇关于延迟物化的文章就介绍到这儿,希望我们推荐的文章对大家有所帮助,也希望大家多多支持为之网!
- 2024-05-01为什么公共事业机构会偏爱 TiDB :TiDB 数据库在某省妇幼健康管理系统的应用
- 2024-04-26敏捷开发:想要快速交付就必须舍弃产品质量?
- 2024-04-26静态代码分析的这些好处,我竟然都不知道?
- 2024-04-26你在测试金字塔的哪一层?(下)
- 2024-04-26快刀斩乱麻,DevOps让代码评审也自动起来
- 2024-04-262024年最好用的10款ER图神器!
- 2024-04-2203-为啥大模型LLM还没能完全替代你?
- 2024-04-2101-大语言模型发展
- 2024-04-17基于SpringWeb MultipartFile文件上传、下载功能
- 2024-04-14个人开发者,Spring Boot 项目如何部署