如何使用Django和Postgres进行全文搜索-创新互联
这篇文章主要介绍如何使用Django和Postgres进行全文搜索,文中介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们一定要看完!
成都创新互联是一家专业提供防城港企业网站建设,专注与成都网站设计、成都做网站、H5技术、小程序制作等业务。10年已为防城港众多企业、政府机构等服务。创新互联专业网站建设公司优惠进行中。项目及其要求
您可能已经注意到,我正在运行工作板。 Voorjob基本上是从lever.co聚合工作,并让用户搜索它。目前,我在数据库中大约有25,000个工作,这个数字增长缓慢,每增加2或3个工作,就会关闭另一个工作。是的,如果我采用了弹性搜索路径,那将是一本教科书过度设计的情况。
实施
从9.4版开始,postgres添加了一些允许全文本搜索的功能。不久之后,Django在postgres特定功能中镜像了这些功能。
要开始使用此新功能,我基本上需要在模型中使用SearchVectorField,并需要使用矢量化的职位描述来更新此字段的方法:
from django.contrib.postgres.search import SearchVectorField, SearchVector class Job(models.Model): title = models.CharField(max_length=200, blank=True) location = models.CharField(max_length=50, blank=True) body = models.TextField(null=True) body_vector = SearchVectorField(null=True) def make_search_vector(): self.body_vector=SearchVector('body') def save(self, *args, **kwargs): self.make_search_vector() super(Model, self).save(*args, **kwargs)
这种方法适用于很少更新的工作,例如工作板,但是如果您的应用程序经常更新,则应避免使用此策略,并应定期执行一些任务来填充向量:
Job.objects.all().update(body_vector=SearchVector('body'))
甚至更好的是,您可以通过阅读本文档,使用postgres触发器直接进行操作。
查询工作
现在您已经准备好数据库,现在可以查询它了,让我们看一下voorjob搜索视图的教学版本:
from django.contrib.postgres.search import SearchQuery class Index(ListView): model = Job paginate_by = 30 def get_queryset(self): search = self.request.GET.get("search", None) queryset = Job.objects.all() if search: if '"' in search: query = SearchQuery(search.replace('"', ''), search_type='phrase') else: query = SearchQuery(search) queryset = queryset.filter(body_vector=query) else: queryset = queryset return queryset
我基本上在这里考虑两种查询:单词存在和“精确表达式”。是的,该逻辑中存在一些缺陷,请继续起诉我:D
还有很多可以改进的地方,django支持加权查询:
vector = SearchVector('title',weight ='A')+ SearchVector('body',weight ='B') Job.objects.all()。update(body_vector = vector)
这最终将以更好的顺序返回结果,其中标题中的匹配比正文中的匹配更重。
查询系统也更加灵活,允许进行逻辑运算OR / AND和NOT。在不久的将来,我将改善对工作板的搜索,并更新此帖子以描述所做的更改。
性能
在开发过程中,我使用了具有16GB内存和不错的NVMe的I5。对本地计算机中的25k作业运行查询基本上是瞬时的。
当我将项目转移到生产环境时(每滴5美元),事情变得越来越慢了。
运行密西西比基准测试,我得到以下结果:
在/ django rest framework上搜索((1个密西西比州以扫描5K条目))
在/ full /上搜索“ django rest framework”(-3个密西西比州,扫描25K条目)
不是最好的性能,但现在可以使用。本文将进行更新以反映任何性能改进。
考虑到我的搜索需求不高-超过25k的条目,且字数过多的文章并不比本文大很多-使用postgres作为我的全文搜索的后端,对于此早期MVP来说效果很好。现在,我比每天给我20个用户提供最快的体验,对尝试事物和扩大董事会成员更感兴趣。
更新(2020年2月9日)
好消息! 我了解到可以将索引添加到SearchVectorField中:
from django.contrib.postgres.indexes import GinIndex class Job(models.Model): class Meta: indexes = (GinIndex(fields=["body_vector"]),) title = models.CharField(max_length=200, blank=True) location = models.CharField(max_length=50, blank=True) body = models.TextField(null=True) body_vector = SearchVectorField(null=True) def make_search_vector(): self.body_vector=SearchVector('body') def save(self, *args, **kwargs): self.make_search_vector() super(Model, self).save(*args, **kwargs)
现在,所有情况下的搜索时间均降至1个密西西比州。 由于我的数据很小,因此用于该索引的内存量可以忽略不计。
以上是“如何使用Django和Postgres进行全文搜索”这篇文章的所有内容,感谢各位的阅读!希望分享的内容对大家有帮助,更多相关知识,欢迎关注创新互联成都网站设计公司行业资讯频道!
另外有需要云服务器可以了解下创新互联scvps.cn,海内外云服务器15元起步,三天无理由+7*72小时售后在线,公司持有idc许可证,提供“云服务器、裸金属服务器、高防服务器、香港服务器、美国服务器、虚拟主机、免备案服务器”等云主机租用服务以及企业上云的综合解决方案,具有“安全稳定、简单易用、服务可用性高、性价比高”等特点与优势,专为企业上云打造定制,能够满足用户丰富、多元化的应用场景需求。
分享标题:如何使用Django和Postgres进行全文搜索-创新互联
标题链接:http://myzitong.com/article/ccjogo.html