AlloyDB और Apache Solr में हाइब्रिड सर्च का इस्तेमाल शुरू करना

1. परिचय

इस कोडलैब में, आपको pgvector और स्केलेबल नियरेस्ट नेबर (स्केन) इंडेक्स का इस्तेमाल करके, AlloyDB में हाइब्रिड सर्च करने का तरीका बताया जाएगा. साथ ही, इसमें फ़ॉरेन डेटा रैपर (एफ़डीडब्ल्यू) के ज़रिए Apache Solr से फ़ुल-टेक्स्ट सर्च की सुविधा को जोड़ने का तरीका भी बताया जाएगा. यह लैब, AlloyDB की एआई सुविधाओं के लिए बनाए गए लैब कलेक्शन का हिस्सा है. दस्तावेज़ में, AlloyDB AI पेज पर जाकर इसके बारे में ज़्यादा पढ़ें.

Apache Solr, Apache Lucene पर बना एक ओपन-सोर्स एंटरप्राइज़ सर्च प्लैटफ़ॉर्म है. इसे फ़ुल-टेक्स्ट सर्च की सुविधा को तेज़, बड़े पैमाने पर, और आसानी से उपलब्ध कराने के लिए डिज़ाइन किया गया है. फ़ॉरेन डेटा रैपर (एफ़डीडब्ल्यू) के ज़रिए Solr को AlloyDB के साथ इंटिग्रेट करने से, उपयोगकर्ता सीधे तौर पर PostgreSQL से Solr इंडेक्स को क्वेरी कर सकते हैं. साथ ही, स्ट्रक्चर्ड डेटाबेस टेबल को भी क्वेरी कर सकते हैं. ज़्यादा जानने के लिए, Apache Solr के दस्तावेज़ पढ़ें.

ज़रूरी शर्तें

  • Google Cloud Console की बुनियादी जानकारी
  • कमांड लाइन इंटरफ़ेस और Google Cloud Shell में बुनियादी कौशल

आपको क्या सीखने को मिलेगा

  • AlloyDB क्लस्टर और प्राइमरी इंस्टेंस को डिप्लॉय करने का तरीका
  • Google Compute Engine वीएम से AlloyDB से कनेक्ट करने का तरीका
  • डेटाबेस बनाने और AlloyDB AI को चालू करने का तरीका
  • डेटाबेस में डेटा लोड करने का तरीका
  • AlloyDB Studio का इस्तेमाल कैसे करें
  • Vertex AI की मदद से एम्बेडिंग जनरेट करना
  • वेक्टर सर्च को बेहतर बनाने के लिए, ScaNN वेक्टर इंडेक्स कैसे बनाएं
  • Apache Solr के लिए, फ़ॉरेन डेटा रैपर (एफ़डीडब्ल्यू) बनाने का तरीका
  • AlloyDB में सिमेंटिक सर्च और Solr में फ़ुल टेक्स्ट सर्च को मिलाकर, हाइब्रिड सर्च करें.

आपको इन चीज़ों की ज़रूरत होगी

  • Google Cloud खाता और Google Cloud प्रोजेक्ट
  • कोई वेब ब्राउज़र, जैसे कि Chrome

2. सेटअप और ज़रूरी शर्तें

प्रोजेक्ट सेटअप करना

Google Cloud Console में साइन इन करें. अगर आपके पास पहले से कोई Gmail या Google Workspace खाता नहीं है, तो आपको एक खाता बनाना होगा.

ऑफ़िस या स्कूल वाले खाते के बजाय, निजी खाते का इस्तेमाल करें.

  1. Google Cloud Console में, प्रोजेक्ट चुनने वाले पेज पर, Google Cloud प्रोजेक्ट चुनें या बनाएं.
  2. पक्का करें कि आपके Cloud प्रोजेक्ट के लिए बिलिंग की सुविधा चालू हो. किसी प्रोजेक्ट के लिए बिलिंग चालू है या नहीं, यह देखने का तरीका जानें.

बिलिंग चालू करें

बिलिंग चालू करने के लिए, आपके पास दो विकल्प हैं. आप अपने निजी बिलिंग खाते का इस्तेमाल कर सकते हैं या यहां दिए गए तरीके से क्रेडिट रिडीम कर सकते हैं.

निजी बिलिंग खाता सेट अप करना

अगर आपने Google Cloud क्रेडिट का इस्तेमाल करके बिलिंग सेट अप की है, तो इस चरण को छोड़ा जा सकता है.

निजी बिलिंग खाता सेट अप करने के लिए, Cloud Console में बिलिंग की सुविधा चालू करने के लिए यहां जाएं.

ध्यान दें:

  • इस लैब को पूरा करने में, क्लाउड संसाधनों पर 3 डॉलर से कम खर्च आना चाहिए.
  • ज़्यादा शुल्क से बचने के लिए, संसाधनों को मिटाने का तरीका जानने के लिए, इस लैब के आखिर में दिए गए निर्देशों का पालन करें.
  • नए उपयोगकर्ता, 300 डॉलर के मुफ़्त में आज़माने की सुविधा का फ़ायदा पा सकते हैं.

Cloud Shell शुरू करें

Google Cloud को अपने लैपटॉप से रिमोटली ऐक्सेस किया जा सकता है. हालांकि, इस कोडलैब में Google Cloud Shell का इस्तेमाल किया जाएगा. यह क्लाउड में चलने वाला कमांड लाइन एनवायरमेंट है.

Cloud Shell, Google Cloud में चलने वाला एक कमांड-लाइन एनवायरमेंट है. इसमें ज़रूरी टूल पहले से लोड होते हैं.

  1. Google Cloud कंसोल में सबसे ऊपर मौजूद, Cloud Shell चालू करें पर क्लिक करें.
  2. Cloud Shell से कनेक्ट होने के बाद, अपने क्रेडेंशियल की पुष्टि करें:
    gcloud auth list
    
  3. पुष्टि करें कि आपका प्रोजेक्ट कॉन्फ़िगर किया गया है:
    gcloud config get project
    
  4. अगर आपका प्रोजेक्ट उम्मीद के मुताबिक सेट नहीं है, तो इसे सेट करें:
    export PROJECT_ID=<YOUR_PROJECT_ID>
    gcloud config set project $PROJECT_ID
    

इस वर्चुअल मशीन में, डेवलपमेंट के लिए ज़रूरी सभी टूल पहले से मौजूद हैं. यह 5 जीबी की होम डायरेक्ट्री उपलब्ध कराता है. साथ ही, Google Cloud पर काम करता है. इससे नेटवर्क की परफ़ॉर्मेंस और पुष्टि करने की प्रोसेस बेहतर होती है. इस कोडलैब में मौजूद सभी टास्क, ब्राउज़र में किए जा सकते हैं. आपको कुछ भी इंस्टॉल करने की ज़रूरत नहीं है.

3. शुरू करने से पहले

एपीआई चालू करना

आउटपुट:

AlloyDB, Compute Engine, नेटवर्किंग सेवाएं, और Vertex AI का इस्तेमाल करने के लिए, आपको अपने Google Cloud प्रोजेक्ट में इनसे जुड़े एपीआई चालू करने होंगे.

एपीआई चालू करना

टर्मिनल में Cloud Shell के अंदर, पक्का करें कि आपका प्रोजेक्ट आईडी सेट अप हो:

gcloud config set project [YOUR-PROJECT-ID]

PROJECT_ID एनवायरमेंट वैरिएबल सेट करें:

PROJECT_ID=$(gcloud config get-value project)

ज़रूरी सभी एपीआई चालू करें:

gcloud services enable alloydb.googleapis.com \
                       compute.googleapis.com \
                       cloudresourcemanager.googleapis.com \
                       servicenetworking.googleapis.com \
                       aiplatform.googleapis.com \
                       secretmanager.googleapis.com

अनुमानित आउटपुट

student@cloudshell:~ (alloydb-hybrid-search)$ gcloud config set project alloydb-hybrid-search
[environment: untagged] Read more to tag: g.co/cloud/project-env-tag.
Updated property [core/project].
student@cloudshell:~ (alloydb-hybrid-search)$ PROJECT_ID=$(gcloud config get-value project)
Your active configuration is: [cloudshell-32544]
student@cloudshell:~ (alloydb-hybrid-search)$ gcloud services enable alloydb.googleapis.com \
                       compute.googleapis.com \
                       cloudresourcemanager.googleapis.com \
                       servicenetworking.googleapis.com \
                       aiplatform.googleapis.com \
                       secretmanager.googleapis.com
Operation "operations/acat.p2-350113473377-5ffc2f22-caa9-4857-b2f4-018657d8bf6e" finished successfully.

एपीआई के बारे में जानकारी

  • AlloyDB API (alloydb.googleapis.com) की मदद से, AlloyDB for PostgreSQL क्लस्टर बनाए, मैनेज किए, और स्केल किए जा सकते हैं. यह पूरी तरह से मैनेज की गई, PostgreSQL के साथ काम करने वाली डेटाबेस सेवा है. इसे एंटरप्राइज़ के लेन-देन और विश्लेषण से जुड़े कामों के लिए डिज़ाइन किया गया है.
  • Compute Engine API (compute.googleapis.com) की मदद से, वर्चुअल मशीनें (वीएम), परसिस्टेंट डिस्क, और नेटवर्क सेटिंग बनाई और मैनेज की जा सकती हैं. यह मुख्य Infrastructure-as-a-Service (IaaS) फ़ाउंडेशन उपलब्ध कराता है. इसकी मदद से, अपने वर्कलोड चलाए जा सकते हैं. साथ ही, मैनेज की जाने वाली कई सेवाओं के लिए बुनियादी इंफ़्रास्ट्रक्चर को होस्ट किया जा सकता है.
  • Cloud Resource Manager API (cloudresourcemanager.googleapis.com) की मदद से, Google Cloud प्रोजेक्ट के मेटाडेटा और कॉन्फ़िगरेशन को प्रोग्राम के हिसाब से मैनेज किया जा सकता है. इससे आपको संसाधनों को व्यवस्थित करने, पहचान और ऐक्सेस मैनेजमेंट (IAM) नीतियों को मैनेज करने, और प्रोजेक्ट के क्रम में अनुमतियों की पुष्टि करने में मदद मिलती है.
  • Service Networking API (servicenetworking.googleapis.com) की मदद से, वर्चुअल प्राइवेट क्लाउड (वीपीसी) नेटवर्क और Google की मैनेज की गई सेवाओं के बीच, निजी कनेक्टिविटी को अपने-आप सेटअप किया जा सकता है. AlloyDB जैसी सेवाओं के लिए, प्राइवेट आईपी ऐक्सेस सेट अप करना ज़रूरी है. इससे वे आपके अन्य संसाधनों के साथ सुरक्षित तरीके से कम्यूनिकेट कर सकती हैं.
  • Vertex AI API (aiplatform.googleapis.com) की मदद से, आपके ऐप्लिकेशन मशीन लर्निंग मॉडल बना सकते हैं, उन्हें डिप्लॉय कर सकते हैं, और बड़े पैमाने पर उपलब्ध करा सकते हैं. यह Google Cloud की सभी एआई सेवाओं के लिए, एक जैसा इंटरफ़ेस उपलब्ध कराता है. इसमें जनरेटिव एआई मॉडल (जैसे, Gemini) का ऐक्सेस और कस्टम मॉडल ट्रेनिंग शामिल है.
  • Secret Manager API (secretmanager.googleapis.com) एक ऐसी सेवा है जो सीक्रेट और क्रेडेंशियल मैनेज करती है. इसकी मदद से, एपीआई पासकोड, उपयोगकर्ता नाम, पासवर्ड, सर्टिफ़िकेट वगैरह जैसे संवेदनशील डेटा को सेव और मैनेज किया जा सकता है.

आपके पास Vertex AI एम्बेडिंग मॉडल का इस्तेमाल करने के लिए, डिफ़ॉल्ट क्षेत्र को कॉन्फ़िगर करने का विकल्प होता है. Vertex AI की सुविधा देने वाले देशों/इलाकों के बारे में ज़्यादा जानें. इस उदाहरण में, हम us-central1 क्षेत्र का इस्तेमाल कर रहे हैं.

gcloud config set compute/region us-central1

4. AlloyDB डिप्लॉय करना

AlloyDB क्लस्टर बनाने से पहले, हमें अपने वीपीसी में एक उपलब्ध निजी आईपी रेंज की ज़रूरत होती है, ताकि आने वाले समय में AlloyDB इंस्टेंस इसका इस्तेमाल कर सके. अगर हमारे पास यह नहीं है, तो हमें इसे बनाना होगा. साथ ही, इसे Google की आंतरिक सेवाओं के लिए इस्तेमाल करने की अनुमति देनी होगी. इसके बाद, हम क्लस्टर और इंस्टेंस बना पाएंगे.

निजी आईपी रेंज बनाना

हमें AlloyDB के लिए, अपने वीपीसी में Private Service Access कॉन्फ़िगरेशन को कॉन्फ़िगर करना होगा. यहां यह मान लिया गया है कि प्रोजेक्ट में "डिफ़ॉल्ट" वीपीसी नेटवर्क है और इसका इस्तेमाल सभी कार्रवाइयों के लिए किया जाएगा.

निजी आईपी रेंज बनाएं:

gcloud compute addresses create psa-range \
    --global \
    --purpose=VPC_PEERING \
    --prefix-length=24 \
    --description="VPC private service access" \
    --network=default

अलॉट की गई आईपी रेंज का इस्तेमाल करके, निजी कनेक्शन बनाएं:

gcloud services vpc-peerings connect \
    --service=servicenetworking.googleapis.com \
    --ranges=psa-range \
    --network=default

कनेक्ट होने के बाद, कस्टम रूट एक्सपोर्ट करने के लिए पियरिंग अपडेट करें:

gcloud compute networks peerings update servicenetworking-googleapis-com \
    --network=default \
    --export-custom-routes

अनुमानित कंसोल आउटपुट:

student@cloudshell:~ (alloydb-hybrid-search)$ gcloud compute addresses create psa-range \
    --global \
    --purpose=VPC_PEERING \
    --prefix-length=24 \
    --description="VPC private service access" \
    --network=default
Created [https://www.googleapis.com/compute/v1/projects/alloydb-hybrid-search/global/addresses/psa-range].

student@cloudshell:~ (alloydb-hybrid-search)$ gcloud services vpc-peerings connect \
    --service=servicenetworking.googleapis.com \
    --ranges=psa-range \
    --network=default
Operation "operations/pssn.p24-350113473377-fadad49e-7e14-472a-8888-26951e40a1f7" finished successfully.

student@cloudshell:~ (alloydb-hybrid-search)$ gcloud compute networks peerings update servicenetworking-googleapis-com \
    --network=default \
    --export-custom-routes
Updated [https://www.googleapis.com/compute/v1/projects/alloydb-hybrid-search/global/networks/default].

AlloyDB क्लस्टर बनाना

इस सेक्शन में, हम us-central1 क्षेत्र में एक AlloyDB क्लस्टर बना रहे हैं.

postgres उपयोगकर्ता के लिए पासवर्ड तय करें. आपके पास अपना पासवर्ड तय करने या पासवर्ड जनरेट करने के लिए, रैंडम फ़ंक्शन का इस्तेमाल करने का विकल्प होता है

export PGPASSWORD=`openssl rand -hex 12`

अनुमानित कंसोल आउटपुट:

student@cloudshell:~ (alloydb-hybrid-search)$ export PGPASSWORD=`openssl rand -hex 12`

PostgreSQL का पासवर्ड नोट करें, ताकि इसे बाद में इस्तेमाल किया जा सके.

echo $PGPASSWORD

postgres उपयोगकर्ता के तौर पर इंस्टेंस से कनेक्ट करने के लिए, आपको आने वाले समय में इस पासवर्ड की ज़रूरत होगी. हमारा सुझाव है कि आप इसे किसी सुरक्षित जगह (जैसे, पासवर्ड मैनेजर) पर कॉपी करें.

अनुमानित कंसोल आउटपुट:

student@cloudshell:~ (alloydb-hybrid-search)$ echo $PGPASSWORD
<generated password>

AlloyDB क्लस्टर बनाना

रीजन और AlloyDB क्लस्टर का नाम तय करें. हम us-central1 क्षेत्र और alloydb-hybrid-search को क्लस्टर के नाम के तौर पर इस्तेमाल करेंगे:

export REGION=us-central1
export ADBCLUSTER=alloydb-hybrid-search

क्लस्टर बनाने के लिए, यह कमांड चलाएं:

gcloud alloydb clusters create $ADBCLUSTER \
    --password=$PGPASSWORD \
    --network=default \
    --region=$REGION \
    --database-version=POSTGRES_17

अनुमानित कंसोल आउटपुट:

student@cloudshell:~ (alloydb-hybrid-search)$ export REGION=us-central1
export ADBCLUSTER=alloydb-hybrid-search
student@cloudshell:~ (alloydb-hybrid-search)$ gcloud alloydb clusters create $ADBCLUSTER \
    --password=$PGPASSWORD \
    --network=default \
    --region=$REGION \
    --database-version=POSTGRES_17
Creating cluster...done.

उसी Cloud Shell सेशन में, हमारे क्लस्टर के लिए AlloyDB प्राइमरी इंस्टेंस बनाएं. अगर आपका कनेक्शन बंद हो जाता है, तो आपको क्षेत्र और क्लस्टर के नाम वाले एनवायरमेंट वैरिएबल फिर से तय करने होंगे.

gcloud alloydb instances create $ADBCLUSTER-pr \
    --instance-type=PRIMARY \
    --cpu-count=2 \
    --region=$REGION \
    --cluster=$ADBCLUSTER

अनुमानित कंसोल आउटपुट:

admin_@cloudshell:~ (my-project-93954-gke)$ gcloud alloydb instances create $ADBCLUSTER-pr \
    --instance-type=PRIMARY \
    --cpu-count=2 \
    --region=$REGION \
    --availability-type ZONAL \
    --cluster=$ADBCLUSTER
Operation ID: operation-1784244706986-656c2d7f3c8f2-59a9e52a-1e7b1b01
Creating instance...done.                                                                                                                                                                                                                                                     

5. AlloyDB से कनेक्ट करना

AlloyDB को सिर्फ़ निजी कनेक्शन का इस्तेमाल करके डिप्लॉय किया जाता है. इसलिए, हमें PostgreSQL क्लाइंट इंस्टॉल किए गए वीएम की ज़रूरत होती है, ताकि हम डेटाबेस के साथ काम कर सकें. हम इस वीएम का इस्तेमाल, Apache Solr इंस्टेंस को चलाने के लिए भी करेंगे.

GCE वीएम डिप्लॉय करना

AlloyDB क्लस्टर के लिए, उसी क्षेत्र और वीपीसी में एक GCE वीएम बनाएं. साथ ही, यह पक्का करें कि बूट डिस्क, Solr को चलाने के लिए काफ़ी बड़ी हो. यहां हमने --create-disk फ़्लैग में 20 जीबी का बूट डिस्क तय किया है.

Cloud Shell में यह कमांड चलाएं:

export ZONE=us-central1-a
gcloud compute instances create instance-1 \
    --zone=$ZONE \
    --create-disk=auto-delete=yes,boot=yes,size=20,image=projects/debian-cloud/global/images/$(gcloud compute images list --filter="family=debian-12 AND family!=debian-12-arm64" --format="value(name)") \
    --scopes=https://www.googleapis.com/auth/cloud-platform

अनुमानित कंसोल आउटपुट:

student@cloudshell:~ (alloydb-hybrid-search)$ export ZONE=us-central1-a
gcloud compute instances create instance-1 \
    --zone=$ZONE \
    --network=default \
    --create-disk=auto-delete=yes,boot=yes,image=projects/debian-cloud/global/images/$(gcloud compute images list --filter="family=debian-12 AND family!=debian-12-arm64" --format="value(name)") \
    --scopes=https://www.googleapis.com/auth/cloud-platform

Created [https://www.googleapis.com/compute/v1/projects/test-project-402417/zones/us-central1-a/instances/instance-1].
NAME: instance-1
ZONE: us-central1-a
MACHINE_TYPE: n1-standard-1
PREEMPTIBLE:
INTERNAL_IP: X.X.X.X
EXTERNAL_IP: X.X.X.X
STATUS: RUNNING

Postgres Client इंस्टॉल करना

डिप्लॉय की गई वीएम पर, PostgreSQL क्लाइंट सॉफ़्टवेयर इंस्टॉल करें

वीएम से कनेक्ट करें:

gcloud compute ssh instance-1 --zone=us-central1-a

अनुमानित कंसोल आउटपुट:

admin_@cloudshell:~ (my-project-93954-gke)$ gcloud compute ssh instance-1 --zone=us-central1-a
Updating project ssh metadata...working..Updated [https://www.googleapis.com/compute/v1/projects/alloydb-hybrid-search].                                                                                                                                                         
Updating project ssh metadata...done.                                                                                                                                                                                                                                              
Waiting for SSH key to propagate.
Warning: Permanently added 'compute.5110295539541121102' (ECDSA) to the list of known hosts.
Linux instance-1.us-central1-a.c.gleb-test-short-001-418811.internal 6.1.0-18-cloud-amd64 #1 SMP PREEMPT_DYNAMIC Debian 6.1.76-1 (2024-02-01) x86_64

The programs included with the Debian GNU/Linux system are free software;
the exact distribution terms for each program are described in the
individual files in /usr/share/doc/*/copyright.

Debian GNU/Linux comes with ABSOLUTELY NO WARRANTY, to the extent
permitted by applicable law.

वर्चुअल मशीन में, कमांड चलाने वाला सॉफ़्टवेयर इंस्टॉल करें:

sudo apt-get update
sudo apt-get install --yes postgresql-client

अनुमानित कंसोल आउटपुट:

student@instance-1:~$ sudo apt-get update
sudo apt-get install --yes postgresql-client
Get:1 https://packages.cloud.google.com/apt google-compute-engine-bullseye-stable InRelease [5146 B]
Get:2 https://packages.cloud.google.com/apt cloud-sdk-bullseye InRelease [6406 B]   
Hit:3 https://deb.debian.org/debian bullseye InRelease  
Get:4 https://deb.debian.org/debian-security bullseye-security InRelease [48.4 kB]
Get:5 https://packages.cloud.google.com/apt google-compute-engine-bullseye-stable/main amd64 Packages [1930 B]
Get:6 https://deb.debian.org/debian bullseye-updates InRelease [44.1 kB]
Get:7 https://deb.debian.org/debian bullseye-backports InRelease [49.0 kB]
...redacted...
Setting up postgresql-client (15+248+deb12u1) ...
Processing triggers for man-db (2.11.2-2) ...
Processing triggers for libc-bin (2.36-9+deb12u14) ...

इंस्टेंस से कनेक्ट करना

psql का इस्तेमाल करके, वीएम से प्राइमरी इंस्टेंस से कनेक्ट करें.

उसी Cloud Shell टैब में, जिसमें instance-1 वीएम के लिए SSH सेशन खुला है.

GCE वीएम से AlloyDB से कनेक्ट करने के लिए, AlloyDB के नोट किए गए पासवर्ड (PGPASSWORD) की वैल्यू और AlloyDB क्लस्टर आईडी का इस्तेमाल करें:

export PGPASSWORD=<Noted password>
export PROJECT_ID=$(gcloud config get-value project)
export REGION=us-central1
export ADBCLUSTER=alloydb-hybrid-search
export INSTANCE_IP=$(gcloud alloydb instances describe $ADBCLUSTER-pr --cluster=$ADBCLUSTER --region=$REGION --format="value(ipAddress)")
psql "host=$INSTANCE_IP user=postgres sslmode=require"

अनुमानित कंसोल आउटपुट:

student@instance-1:~$ export PROJECT_ID=$(gcloud config get-value project)
export REGION=us-central1
export ADBCLUSTER=alloydb-hybrid-search
export INSTANCE_IP=$(gcloud alloydb instances describe $ADBCLUSTER-pr --cluster=$ADBCLUSTER --region=$REGION --format="value(ipAddress)")
psql "host=$INSTANCE_IP user=postgres sslmode=require"
psql (15.18 (Debian 15.18-0+deb12u1), server 17.9)
WARNING: psql major version 15, server major version 17.
         Some psql features might not work.
SSL connection (protocol: TLSv1.3, cipher: TLS_AES_256_GCM_SHA384, compression: off)
Type "help" for help.

postgres=> 

psql सेशन बंद करें:

exit

6. डेटाबेस तैयार करना

हमें एक डेटाबेस बनाना होगा. साथ ही, Vertex AI इंटिग्रेशन को चालू करना होगा, डेटाबेस ऑब्जेक्ट बनाने होंगे, और डेटा इंपोर्ट करना होगा.

AlloyDB को ज़रूरी अनुमतियां देना

AlloyDB सेवा एजेंट को Vertex AI की अनुमतियां दें.

सबसे ऊपर मौजूद "+" साइन का इस्तेमाल करके, Cloud Shell का कोई दूसरा टैब खोलें.

abc1.png

नए Cloud Shell टैब में यह कमांड चलाएं:

PROJECT_ID=$(gcloud config get-value project)
gcloud projects add-iam-policy-binding $PROJECT_ID \
  --member="serviceAccount:service-$(gcloud projects describe $PROJECT_ID --format="value(projectNumber)")@gcp-sa-alloydb.iam.gserviceaccount.com" \
  --role="roles/aiplatform.user"

अनुमानित कंसोल आउटपुट:

admin_@cloudshell:~ (my-project-93954-gke)$ PROJECT_ID=$(gcloud config get-value project)
gcloud projects add-iam-policy-binding $PROJECT_ID \
  --member="serviceAccount:service-$(gcloud projects describe $PROJECT_ID --format="value(projectNumber)")@gcp-sa-alloydb.iam.gserviceaccount.com" \
  --role="roles/aiplatform.user"
Your active configuration is: [cloudshell-30137]

Updated IAM policy for project [my-project-93954-gke].
bindings:
- members:
<redacted>
version: 1

"X" पर क्लिक करके या यह कमांड चलाकर टैब बंद करें:

exit

डेटाबेस बनाएं

quickstart नाम का डेटाबेस बनाएं.

GCE वीएम सेशन में यह कमांड चलाएं:

डेटाबेस बनाएं:

psql "host=$INSTANCE_IP user=postgres" -c "CREATE DATABASE quickstart_db"

अनुमानित कंसोल आउटपुट:

student@instance-1:~$ psql "host=$INSTANCE_IP user=postgres" -c "CREATE DATABASE quickstart_db"
CREATE DATABASE

Vertex AI इंटिग्रेशन चालू करना

डेटाबेस में Vertex AI इंटिग्रेशन और pgvector एक्सटेंशन चालू करें.

GCE वीएम में यह कमांड चलाएं:

psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "CREATE EXTENSION IF NOT EXISTS google_ml_integration CASCADE"
psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "CREATE EXTENSION IF NOT EXISTS vector"

अनुमानित कंसोल आउटपुट:

student@instance-1:~$ psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "CREATE EXTENSION IF NOT EXISTS google_ml_integration CASCADE"
psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "CREATE EXTENSION IF NOT EXISTS vector"
NOTICE:  extension "google_ml_integration" already exists, skipping
CREATE EXTENSION
CREATE EXTENSION

डेटा इंपोर्ट करना

तैयार किए गए डेटा को डाउनलोड करें और उसे नए डेटाबेस में इंपोर्ट करें.

GCE वीएम में यह कमांड चलाएं:

gcloud storage cat gs://cloud-training/gcc/gcc-tech-004/cymbal_demo_schema.sql |psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db"
gcloud storage cat gs://cloud-training/gcc/gcc-tech-004/cymbal_products.csv |psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "\copy cymbal_products from stdin csv header"
gcloud storage cat gs://cloud-training/gcc/gcc-tech-004/cymbal_inventory.csv |psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "\copy cymbal_inventory from stdin csv header"
gcloud storage cat gs://cloud-training/gcc/gcc-tech-004/cymbal_stores.csv |psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "\copy cymbal_stores from stdin csv header"

अनुमानित कंसोल आउटपुट:

student@instance-1:~$ gcloud storage cat gs://cloud-training/gcc/gcc-tech-004/cymbal_demo_schema.sql |psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db"
gcloud storage cat gs://cloud-training/gcc/gcc-tech-004/cymbal_products.csv |psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "\copy cymbal_products from stdin csv header"
gcloud storage cat gs://cloud-training/gcc/gcc-tech-004/cymbal_inventory.csv |psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "\copy cymbal_inventory from stdin csv header" 
gcloud storage cat gs://cloud-training/gcc/gcc-tech-004/cymbal_stores.csv |psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db" -c "\copy cymbal_stores from stdin csv header"
SET
SET
SET
SET
SET
 set_config 
------------
 
(1 row)

SET
SET
SET
SET
SET
SET
CREATE TABLE
ALTER TABLE
CREATE TABLE
ALTER TABLE
CREATE TABLE
ALTER TABLE
CREATE TABLE
ALTER TABLE
CREATE SEQUENCE
ALTER TABLE
ALTER SEQUENCE
ALTER TABLE
ALTER TABLE
ALTER TABLE
COPY 941
COPY 263861
COPY 4654

इसके बाद, ज़रूरी डेटाबेस फ़्लैग सेट करते हैं. वेब कंसोल का इस्तेमाल करके, प्राइमरी इंस्टेंस में फ़्लैग मैनेज किए जा सकते हैं. इसके अलावा, gcloud कमांड का इस्तेमाल इस तरह किया जा सकता है:

export PROJECT_ID=$(gcloud config get-value project)
export REGION=us-central1
export ADBCLUSTER=alloydb-hybrid-search
gcloud beta alloydb instances update $ADBCLUSTER-pr \
   --database-flags google_ml_integration.enable_faster_embedding_generation=on,scann.enable_preview_features=on,google_ml_integration.enable_preview_ai_functions=on,google_ml_integration.enable_ai_query_engine=on \
   --region=$REGION \
   --cluster=$ADBCLUSTER \
   --project=$PROJECT_ID \
   --update-mode=FORCE_APPLY

कंसोल में दिखने वाला अनुमानित आउटपुट

student@cloudshell:~ (alloydb-hybrid-search)$ export PROJECT_ID=$(gcloud config get-value project)
export REGION=us-central1
export ADBCLUSTER=alloydb-hybrid-search
gcloud beta alloydb instances update $ADBCLUSTER-pr \
   --database-flags google_ml_integration.enable_faster_embedding_generation=on,scann.enable_preview_features=on,google_ml_integration.enable_preview_ai_functions=on,google_ml_integration.enable_ai_query_engine=on \
   --region=$REGION \
   --cluster=$ADBCLUSTER \
   --project=$PROJECT_ID \
   --update-mode=FORCE_APPLY
Your active configuration is: [cloudshell-30137]
Operation ID: operation-1784245853151-656c31c44e12b-6084eb8b-d6611419

डेटाबेस फ़्लैग चालू करने के लिए, इंस्टेंस को रीस्टार्ट करना होगा. इसमें कुछ मिनट लगेंगे. सेटअप पूरा होने के बाद, AlloyDB इंस्टेंस की स्थिति "तैयार है" के तौर पर दिखेगी.

7. वेक्टर एम्बेडिंग जनरेट करना

डेटा इंपोर्ट करने के बाद, हमारे पास ये टेबल हैं: cymbal_products जिसमें प्रॉडक्ट के बारे में जानकारी होती है, cymbal_inventory जो हर स्टोर में आइटम के स्टॉक को ट्रैक करती है, और cymbal_stores जो स्टोर की सूची है. अपने प्रॉडक्ट पर सिमैंटिक सर्च करने के लिए, हमें initialize_embeddings फ़ंक्शन का इस्तेमाल करके, अपने प्रॉडक्ट की जानकारी की वेक्टर एम्बेडिंग जनरेट करनी होगी. हम Vertex AI इंटिग्रेशन का इस्तेमाल करके, प्रॉडक्ट के ब्यौरे के आधार पर वेक्टर डेटा का हिसाब लगाएंगे और उसे टेबल में जोड़ेंगे. इस्तेमाल की गई टेक्नोलॉजी के बारे में ज़्यादा जानने के लिए, दस्तावेज़ पढ़ें.

इंटिग्रेशन का इस्तेमाल करने के लिए, AlloyDB studio या अपनी वीएम से psql का इस्तेमाल करके डेटाबेस से कनेक्ट करें. इसके लिए, AlloyDB इंस्टेंस के आईपी पते और Postgres पासवर्ड का इस्तेमाल करें:

psql "host=$INSTANCE_IP user=postgres dbname=quickstart_db"

google_ml_integration एक्सटेंशन के वर्शन की पुष्टि करें.

SELECT extversion FROM pg_extension WHERE extname = 'google_ml_integration';

वर्शन 1.5.2 या इसके बाद का होना चाहिए. यहां आउटपुट का उदाहरण दिया गया है:

quickstart_db=> SELECT extversion FROM pg_extension WHERE extname = 'google_ml_integration';
 extversion 
------------
 1.5.9
(1 row)

डिफ़ॉल्ट वर्शन 1.5.2 या उसके बाद का होना चाहिए. हालांकि, अगर आपके इंस्टेंस में पुराना वर्शन दिख रहा है, तो शायद इसे अपडेट करने की ज़रूरत है. देखें कि इंस्टेंस के लिए रखरखाव की सुविधा बंद तो नहीं की गई है.

वेक्टर एक्सटेंशन इंस्टॉल करें और cymbal_products में एम्बेडिंग सेव करने के लिए एक नया कॉलम बनाएं

CREATE EXTENSION IF NOT EXISTS vector;
ALTER TABLE cymbal_products ADD COLUMN product_embedding vector(768);

अनुमानित कंसोल आउटपुट:

quickstart_db=> CREATE EXTENSION IF NOT EXISTS vector;
ALTER TABLE cymbal_products ADD COLUMN product_embedding vector(768);
NOTICE:  extension "vector" already exists, skipping
CREATE EXTENSION
ALTER TABLE

हम बेहतर तरीके से काम करने के लिए, बैच एम्बेडिंग जनरेशन का इस्तेमाल करेंगे. गाइड में, एम्बेडिंग जनरेट करने के अलग-अलग विकल्पों और तकनीकों के बारे में ज़्यादा जानें. हमने पहले google_ml_integration.enable_faster_embedding_generation फ़्लैग चालू किया था. इससे हमें एक साथ कई एम्बेड जनरेट करने की सुविधा मिलती है.

आखिर में, हम यह भी चाहते हैं कि कॉलम की वैल्यू में बदलाव होने पर, एम्बेडिंग रीफ़्रेश हो जाएं. इसके लिए, फ़ंक्शन कॉल में incremental_refresh_mode आर्ग्युमेंट शामिल करें. इससे हमारे डेटाबेस पर अतिरिक्त बोझ पड़ता है. हालांकि, हम इस ट्रेड-ऑफ़ को इसलिए स्वीकार करते हैं, ताकि एम्बेड किए गए कॉन्टेंट को अपने-आप सिंक किया जा सके. अगर आपको एम्बेड किए गए डेटा को मैन्युअल तरीके से अपडेट करना है, तो दस्तावेज़ में दिए गए निर्देशों को पढ़ें.

अब इन सभी को एक साथ रखकर एम्बेडिंग जनरेट करने के लिए, हम initialize_embeddings फ़ंक्शन का इस्तेमाल करते हैं. साथ ही, बैच के लिए 50 का सुझाव देते हैं और incremental_refresh_mode को transactional पर सेट करते हैंbatch_size

CALL ai.initialize_embeddings(
    model_id => 'text-embedding-005',
    table_name => 'cymbal_products',
    content_column => 'product_description',
    embedding_column => 'product_embedding',
    batch_size => 50,
    incremental_refresh_mode => 'transactional'
);

अब अगर हम टेबल में एक नई लाइन जोड़ते हैं, जिसमें product_embedding कॉलम के लिए NULL वैल्यू है

INSERT INTO "cymbal_products" ("uniq_id", "crawl_timestamp", "product_url", "product_name", "product_description", "list_price", "sale_price", "brand", "item_number", "gtin", "package_size", "category", "postal_code", "available", "product_embedding") VALUES ('fd604542e04b470f9e6348e640cff794', NOW(), 'https://example.com/new_product', 'New Cymbal Product', 'This is a new cymbal product description.', 199.99, 149.99, 'Example Brand', 'EB123', '1234567890', 'Single', 'Cymbals', '12345', TRUE, NULL);

अब जब हम उस लाइन के बारे में क्वेरी करेंगे जिसे हमने अभी डाला है, तो हमें दिखेगा कि product_embedding कॉलम अपने-आप अपडेट हो गया है.

SELECT uniq_id, (product_embedding::real[])[1:5] as product_embedding  FROM cymbal_products WHERE uniq_id='fd604542e04b470f9e6348e640cff794';

आउटपुट ऐसा दिखना चाहिए:

quickstart_db=> SELECT uniq_id,(product_embedding::real[])[1:5] as product_embedding  FROM cymbal_products WHERE uniq_id='fd604542e04b470f9e6348e640cff794';
             uniq_id              |                      product_embedding                       
----------------------------------+---------------------------------------------------------------
 fd604542e04b470f9e6348e640cff794 | {0.015003494,-0.005349732,-0.059790313,-0.0087091,-0.0271452}
(1 row)

8. वेक्टर इंडेक्स बनाना

वेक्टर सर्च की परफ़ॉर्मेंस को बेहतर बनाने के लिए, हम ScaNN इंडेक्स जोड़ेंगे.

ScaNN इंडेक्स बनाना

SCANN इंडेक्स बनाने के लिए, हमें एक और एक्सटेंशन चालू करना होगा. alloydb_scann एक्सटेंशन, Google के ScaNN एल्गोरिदम का इस्तेमाल करके, ANN टाइप के वेक्टर इंडेक्स के साथ काम करने के लिए एक इंटरफ़ेस उपलब्ध कराता है.

CREATE EXTENSION IF NOT EXISTS alloydb_scann;

अनुमानित आउटपुट:

quickstart_db=> CREATE EXTENSION IF NOT EXISTS alloydb_scann;
CREATE EXTENSION

इंडेक्स को मैन्युअल या ऑटो मोड में बनाया जा सकता है. मैन्युअल मोड डिफ़ॉल्ट रूप से चालू होता है. इसमें किसी भी अन्य इंडेक्स की तरह इंडेक्स बनाया और उसे मैनेज किया जा सकता है. हालांकि, AUTO मोड चालू करने पर, ऐसा इंडेक्स बनाया जा सकता है जिसे आपको मैनेज करने की ज़रूरत नहीं होती. सभी विकल्पों के बारे में ज़्यादा जानकारी पाने के लिए, दस्तावेज़ पढ़ें. हमारे मामले में, AUTO मोड में इंडेक्स बनाने के लिए हमारे पास ज़रूरत के मुताबिक लाइनें नहीं हैं. इसलिए, हम इसे MANUAL के तौर पर बनाएंगे और इसमें ट्यूनिंग पैरामीटर शामिल करेंगे. दस्तावेज़ में जाकर, इंडेक्स पैरामीटर को ट्यून करने के बारे में पढ़ें.

CREATE INDEX cymbal_products_embeddings_scann ON cymbal_products
  USING scann (product_embedding cosine)
  WITH (mode='MANUAL', num_leaves=31, max_num_levels = 2);

अनुमानित आउटपुट:

quickstart_db=> CREATE INDEX cymbal_products_embeddings_scann ON cymbal_products
  USING scann (product_embedding cosine)
  WITH (num_leaves=31, max_num_levels = 2);
CREATE INDEX
quickstart_db=>

इंडेक्स के इस्तेमाल की जांच करना

अब हम EXPLAIN मोड में वेक्टर सर्च क्वेरी चला सकते हैं. साथ ही, यह पुष्टि कर सकते हैं कि इंडेक्स का इस्तेमाल किया जा रहा है या नहीं.

EXPLAIN (analyze)
WITH trees as (
SELECT
        cp.product_name,
        left(cp.product_description,80) as description,
        cp.sale_price,
        cs.zip_code,
        cp.uniq_id as product_id
FROM
        cymbal_products cp
JOIN cymbal_inventory ci on
        ci.uniq_id=cp.uniq_id
JOIN cymbal_stores cs on
        cs.store_id=ci.store_id
        AND ci.inventory>0
        AND cs.store_id = 1583
ORDER BY
        (cp.product_embedding <=> embedding('text-embedding-005','What kind of fruit trees grow well here?')::vector) ASC
LIMIT 1)
SELECT json_agg(trees) FROM trees;

अनुमानित आउटपुट (ज़्यादा जानकारी के लिए, कुछ हिस्सों को छिपा दिया गया है):

...
Aggregate (cost=16.59..16.60 rows=1 width=32) (actual time=2.875..2.877 rows=1 loops=1)
-> Subquery Scan on trees (cost=8.42..16.59 rows=1 width=142) (actual time=2.860..2.862 rows=1 loops=1)
-> Limit (cost=8.42..16.58 rows=1 width=158) (actual time=2.855..2.856 rows=1 loops=1)
-> Nested Loop (cost=8.42..6489.19 rows=794 width=158) (actual time=2.854..2.855 rows=1 loops=1)
-> Nested Loop (cost=8.13..6466.99 rows=794 width=938) (actual time=2.742..2.743 rows=1 loops=1)
-> Index Scan using cymbal_products_embeddings_scann on cymbal_products cp (cost=7.71..111.99 rows=876 width=934) (actual time=2.724..2.724 rows=1 loops=1)
Order By: (embedding <=> '[0.008864171,0.03693164,-0.024245683,-0.00355923,0.0055611245,0.015985578,...<redacted>...5685,-0.03914233,-0.018452475,0.00826032,-0.07372604]'::vector)
...

आउटपुट से पता चलता है कि क्वेरी में "cymbal_products_embeddings_scann on cymbal_products" का इस्तेमाल किया गया था.

9. Solr इंस्टेंस बनाना

हम हाइब्रिड सर्च के फ़ुल टेक्स्ट सर्च (एफ़टीएस) वाले हिस्से के लिए, Apache Solr का इस्तेमाल करेंगे. इस चरण में, आपने पहले जो वीएम बनाया था उसमें स्टैंडअलोन Solr इंस्टेंस डिप्लॉय किया जाएगा.

Solr का ऐक्सेस सुरक्षित करने के लिए, हम बुनियादी पुष्टि करने की सुविधा चालू करेंगे. इसके लिए, हम security.json कॉन्फ़िगरेशन फ़ाइल उपलब्ध कराएंगे, उसे माउंट करेंगे, और Solr डॉकर कंटेनर शुरू करेंगे.

वीएम में एसएसएच करें और Docker इंस्टॉल करें:

sudo apt-get update
sudo apt-get install -y ca-certificates curl gnupg
sudo install -m 0755 -d /etc/apt/keyrings
curl -fsSL https://download.docker.com/linux/debian/gpg | sudo gpg --dearmor -o /etc/apt/keyrings/docker.gpg
sudo chmod a+r /etc/apt/keyrings/docker.gpg

echo \
  "deb [arch="$(dpkg --print-architecture)" signed-by=/etc/apt/keyrings/docker.gpg] https://download.docker.com/linux/debian \
  "$(. /etc/os-release && echo "$VERSION_CODENAME")" stable" | \
  sudo tee /etc/apt/sources.list.d/docker.list > /dev/null
sudo apt-get update
sudo apt-get install -y docker-ce docker-ce-cli containerd.io docker-buildx-plugin docker-compose-plugin

अब आपके पास, उपयोगकर्ता के लिए Docker कमांड में बदलाव करने का विकल्प है:

sudo usermod -aG docker $USER
newgrp docker

अब, उपयोगकर्ता नाम solr और पासवर्ड SolrRocks की मदद से बुनियादी पुष्टि करने की सुविधा चालू करने के लिए, security.json फ़ाइल बनाएं.

nano security.json

फ़ाइल में यह JSON चिपकाएं:

{
  "authentication": {
    "blockUnknown": true,
    "class": "solr.BasicAuthPlugin",
    "credentials": {
      "solr": "IV0EHq1OnNrj6gvRCwvFwTrZ1+z1oBbnQdiVC3otuq0= Ndd7LKvVBAaZIF0QAVi1ekCfAJXr1GGfLtRUXhgrF8c="
    }
  },
  "authorization": {
    "class": "solr.RuleBasedAuthorizationPlugin",
    "permissions": [
      { "name": "security-edit", "role": "admin" }
    ],
    "user-role": { "solr": "admin" }
  }
}

nano से बाहर निकलने के लिए, सेव करें (Ctrl + O, Enter, Ctrl + X).

docker run का इस्तेमाल करके Solr डॉकर कंटेनर शुरू करें और security.json फ़ाइल को कंटेनर में माउंट करें:

docker run -d -p 8983:8983 --name solr --user root -v "$(pwd)/security.json:/var/solr/data/security.json" solr:9 -c -force

पुष्टि करें कि कंटेनर चल रहा है या नहीं:

docker ps

अनुमानित आउटपुट:

student@instance-1:~$ docker ps
CONTAINER ID   IMAGE     COMMAND                  CREATED         STATUS         PORTS                                         NAMES
90db3c73835e   solr:9    "docker-entrypoint.s..."   7 seconds ago   Up 3 seconds   0.0.0.0:8983->8983/tcp, [::]:8983->8983/tcp   solr

Solr को कुछ सेकंड तक शुरू होने दें. इसके बाद, solrindexdemo नाम का नया कलेक्शन बनाएं. इसके लिए, बुनियादी पुष्टि वाले क्रेडेंशियल का इस्तेमाल करके Solr API को हिट करें:

curl --user solr:SolrRocks -X POST "http://localhost:8983/solr/admin/collections?action=CREATE&name=solrindexdemo&numShards=1&replicationFactor=1"

अनुमानित आउटपुट:

student@instance-1:~$ curl --user solr:SolrRocks -X POST "http://localhost:8983/solr/admin/collections?action=CREATE&name=solrindexdemo&numShards=1&replicationFactor=1"
{
  "responseHeader":{
    "status":0,
    "QTime":3586
  },
  "success":{
    "172.17.0.2:8983_solr":{
      "responseHeader":{
        "status":0,
        "QTime":2405
      },
      "core":"solrindexdemo_shard1_replica_n1"
    }
  },
  "warning":"Using _default configset. Data driven schema functionality is enabled by default, which is NOT RECOMMENDED for production use. To turn it off: curl http://{host:port}/solr/solrindexdemo/config -d '{\"set-user-property\": {\"update.autoCreateFields\":\"false\"}}'"

अब हम Solr इंस्टेंस में प्रॉडक्ट के नाम और ब्यौरे भरेंगे. क्लाउड स्टोरेज से वीएम में प्रॉडक्ट की CSV फ़ाइल कॉपी करें.

gcloud storage cp gs://cloud-training/gcc/gcc-tech-004/cymbal_products.csv .

अब CSV फ़ाइल से डेटा निकालने और उसे एक साथ अपडेट करने के लिए, डेटा को JSON फ़ॉर्मैट में बदलने के लिए Python स्क्रिप्ट बनाएं.

nano convert.py

फ़ाइल में यह जानकारी चिपकाएं:

import csv
import json

# Configuration
input_file = 'cymbal_products.csv'
output_file = 'products.json'

def convert():
    try:
        with open(input_file, mode='r', encoding='utf-8') as f_in, \
             open(output_file, mode='w', encoding='utf-8') as f_out:
            
            reader = csv.DictReader(f_in)
            
            products = []
            for row in reader:
                products.append({
                    "id": row['uniq_id'].strip(),
                    "product_name": row['product_name'].strip(),
                    "product_description": row['product_description'].strip()
                })
                
            json.dump(products, f_out, indent=2)
            print(f"Success: Processed {len(products)} products.")
            print(f"Output saved to: {output_file}")

    except Exception as e:
        print(f"An error occurred: {e}")

if __name__ == "__main__":
    convert()

फ़ाइल को सेव करें और उसे रन करें:

python3 convert.py

अनुमानित आउटपुट:

admin_gopalbhutada_altostrat_com@instance-1:~$ python3 convert.py
Success: Processed 941 products.
Output saved to: products.json

अब अपडेट हैंडलर का इस्तेमाल करके, JSON डेटा को Apache Solr पर भेजें:

curl --user solr:SolrRocks -X POST -H 'Content-Type: application/json' \
  'http://localhost:8983/solr/solrindexdemo/update?commit=true' \
  --data-binary "@products.json"

अनुमानित आउटपुट:

admin_gopalbhutada_altostrat_com@instance-1:~$ curl --user solr:SolrRocks -X POST -H 'Content-Type: application/json' \
  'http://localhost:8983/solr/solrindexdemo/update?commit=true' \
  --data-binary "@products.json"
{
  "responseHeader":{
    "rf":1,
    "status":0,
    "QTime":3220
  }
}

अब हमें Secret Manager में एक सीक्रेट बनाना होगा, जिसमें Solr क्रेडेंशियल सेव किए जाएंगे. AlloyDB, बुनियादी पुष्टि के लिए base64-encoded username:password वैल्यू का इस्तेमाल करके, बाहरी सर्च FDW से लिंक करता है. इसलिए, आइए पहले username:password के लिए base64-encoded स्ट्रिंग पाएं:solr:SolrRocks

echo -n "solr:SolrRocks" | base64

आउटपुट:

admin_gopalbhutada_altostrat_com@instance-1:~$ echo -n "solr:SolrRocks" | base64
c29scjpTb2xyUm9ja3M=

base64 फ़ॉर्मैट में कोड में बदले गए इस क्रेडेंशियल का इस्तेमाल करके, Google Secret Manager में एक सीक्रेट बनाएं. Cloud Shell में, यह कमांड चलाएं:

echo -n "c29scjpTb2xyUm9ja3M=" | \
gcloud secrets create solr-credentials \
    --replication-policy="automatic" \
    --data-file=-

10. AlloyDB में फ़ॉरेन डेटा रैपर बनाना

अवधि 10:00

AlloyDB से Apache Solr में सेव किए गए डेटा को क्वेरी करने के लिए, हमें Solr के लिए फ़ॉरेन डेटा रैपर (एफ़डीडब्ल्यू) और एक फ़ॉरेन टेबल बनानी होगी. आपने पहले Solr के क्रेडेंशियल, Secret Manager में सेव किए थे. AlloyDB को सीक्रेट ऐक्सेस करने की अनुमति देने के लिए, सेवा खाते को ज़रूरी अनुमति दें.

Cloudshell में, सेवा खाते को solr-credentials सीक्रेट का ऐक्सेस दें:

gcloud secrets add-iam-policy-binding solr-credentials \
    --member="serviceAccount:service-$(gcloud projects describe $(gcloud config get-value project) --format='value(projectNumber)')@gcp-sa-alloydb.iam.gserviceaccount.com" \
    --role="roles/secretmanager.secretAccessor"

अनुमानित आउटपुट:

admin_@cloudshell:~ (my-project-93954-gke)$ gcloud secrets add-iam-policy-binding solr-credentials \
    --member="serviceAccount:service-$(gcloud projects describe $(gcloud config get-value project) --format='value(projectNumber)')@gcp-sa-alloydb.iam.gserviceaccount.com" \
    --role="roles/secretmanager.secretAccessor"
Your active configuration is: [cloudshell-13031]
Updated IAM policy for secret [solr-credentials].
bindings:
- members:
  - serviceAccount:service-350113473377@gcp-sa-alloydb.iam.gserviceaccount.com
  role: roles/secretmanager.secretAccessor
etag: BwZWyKlkx6Q=
version: 1

AlloyDB Studio का इस्तेमाल करके डेटाबेस से कनेक्ट करें. इसके अलावा, VM से कनेक्ट करने के लिए psql का इस्तेमाल करें. postgres उपयोगकर्ता के तौर पर quickstart_db में लॉग इन करें.

FDW एक्सटेंशन चालू करें:

CREATE EXTENSION IF NOT EXISTS external_search_fdw;

अनुमानित आउटपुट:

CREATE EXTENSION

कनेक्शन पैरामीटर पाएं

AlloyDB में फ़ॉरेन डेटा सर्वर कॉन्फ़िगर करने से पहले, आपको वीएम का इंटरनल आईपी पता (जहां Solr चल रहा है) और सीक्रेट पाथ की ज़रूरत होगी.

वीएम के इंटरनल आईपी को प्रिंट करने के लिए, Cloud Shell में यह कमांड चलाएं:

gcloud compute instances describe instance-1 \
    --zone=us-central1-a \
    --format="value(networkInterfaces[0].networkIP)"

अनुमानित आउटपुट:

10.X.X.X

Secret Manager में सीक्रेट रिसॉर्स पाथ को प्रिंट करने के लिए, यह कमांड चलाएं:

gcloud secrets describe solr-credentials --format="value(name)"

अनुमानित आउटपुट:

projects/<project_id>/secrets/solr-credentials

Apache Solr का इस्तेमाल करने के लिए, फ़ॉरेन डेटा सर्वर बनाएं. नीचे दी गई क्वेरी में, और को अपनी ज़रूरत के हिसाब से बदली गई वैल्यू से बदलें. पक्का करें कि आपने सीक्रेट के सबसे नए वर्शन को पाने के लिए, अपने सीक्रेट पाथ में /versions/latest जोड़ा हो:

CREATE SERVER solr_demo_server
FOREIGN DATA WRAPPER external_search_fdw
OPTIONS(
    server 'http://<VM_INTERNAL_IP_ADDRESS>:8983',
    search_provider 'solr',
    auth_mode 'secret_manager',
    auth_method 'Basic',
    secret_path '<SECRET_PATH>/versions/latest'
);

अनुमानित आउटपुट:

CREATE SERVER

इसके बाद, फ़ॉरेन टेबल तय करें. मेटाडेटा के बाद, Solr फ़ील्ड स्कीमा की परिभाषा दें, ताकि पहले से लोड किए गए डेटा से मैच किया जा सके. रिमोट टेबल में, Solr कलेक्शन का नाम डालें.

CREATE FOREIGN TABLE solrindexdemo (
    metadata external_search_fdw_schema.OpaqueMetadata,
    id TEXT,
    product_name TEXT,
    product_description TEXT
)
SERVER solr_demo_server
OPTIONS(
    remote_table_name 'solrindexdemo'
);

सर्वर के लिए उपयोगकर्ता मैपिंग बनाएं:

CREATE USER MAPPING FOR CURRENT_USER SERVER solr_demo_server;

अब बाहरी टेबल को टेस्ट किया जा सकता है:

SELECT id, product_name
FROM solrindexdemo
ORDER BY metadata <@> 'product_description:cherry' DESC
limit 10;

अनुमानित आउटपुट:

"id","product_name"
"d536e9e823296a2eba198e52dd23e712","Cherry Tree"
"390cf08feac229e7b752709fd1f943b3","Woven Round Placemat, Set of Twelve, Grass"
"2c9aa7ac98c30abf78dd9c62a68a34e6","48 Scented Wax Melts Wax Cubes: Jelly Belly Jelly Beans Candy Bulk Soy Wax Melts For Candle Warmer, Wax Warmers, Wax Melt Warmers In 8 Pack Set"

11. हाइब्रिड सर्च का इस्तेमाल करना

अवधि 10:00

अब सब कुछ सेट अप हो गया है. इसलिए, हम वेक्टर सर्च और फ़ुल टेक्स्ट सर्च को एक साथ इस्तेमाल करने के लिए, ai.hybrid_search() फ़ंक्शन का इस्तेमाल कर सकते हैं. दस्तावेज़ में जाकर, हाइब्रिड सर्च के बारे में ज़्यादा जानें. हाइब्रिड सर्च का इस्तेमाल करते समय, क्वेरी के नतीजे डिफ़ॉल्ट रूप से रेसिप्रोकल रैंक फ़्यूज़न एल्गोरिदम का इस्तेमाल करते हैं. इससे, कई क्वेरी के नतीजों को रैंक के हिसाब से क्रम में लगाया जाता है. सबसे पहले, वेक्टर सर्च और हाइब्रिड सर्च को अलग-अलग आज़माकर देखते हैं, ताकि इनके बीच के अंतर का विश्लेषण किया जा सके.

नीचे दी गई क्वेरी, चेरी से मिलते-जुलते प्रॉडक्ट खोजने के लिए वेक्टर सर्च करती है. ऐरे, खोजों की एक सूची उपलब्ध कराता है. इस मामले में, हम सिर्फ़ वेक्टर सर्च का इस्तेमाल करते हैं. हालांकि, बाद में हम वेक्टर और एफ़टीएस, दोनों उपलब्ध कराएंगे.

SELECT id, score, cymbal_products.product_name, cymbal_products.product_description
FROM ai.hybrid_search(
  ARRAY[
      '{
        "data_type": "vector",
        "table_name": "cymbal_products",
        "key_column": "uniq_id",
        "vec_column": "product_embedding",
        "distance_operator": "public.<=>",
        "limit": 3,
        "query_vector": "ai.embedding(''text-embedding-005'', ''cherry'')::vector"
      }'::JSONB
  ]
) JOIN cymbal_products ON id = cymbal_products.uniq_id;

आउटपुट में, चेरी के पेड़ को पहला नतीजा दिखाया गया है. हालांकि, ध्यान दें कि अगले दो नतीजे भी फलों के पेड़ों के बारे में हैं. ऐसा इसलिए होता है, क्योंकि product_description कॉलम में वेक्टर सर्च का इस्तेमाल करने पर, हमें खोज की शर्त से मिलते-जुलते शब्द मिलते हैं.

"id","score","product_name","product_description"
"d536e9e823296a2eba198e52dd23e712","0.01639344262295082","Cherry Tree","This is a beautiful cherry tree that will produce delicious cherries. It is an deciduous tree that grows to be about 15 feet tall. The leaves are dark green in the summer and turn a beautiful red in the fall. Cherry trees are known for their beauty and their ability to provide shade and privacy. Cherry trees prefer a cool, moist climate and sandy soil. They are best suited for USDA zones 4-9."
"b70c44b1a38c0a2329fa583c9109a80f","0.016129032258064516","Peach Tree","This is a beautiful peach tree that will produce delicious peaches. It is an evergreen tree that grows to be about 20 feet tall. The leaves are dark green in the summer and turn a beautiful yellow in the fall. Peach trees are known for their beauty and their ability to provide shade and privacy. Peach trees prefer a cool, moist climate and sandy soil. They are best suited for USDA zones 2-9."
"23e41a71d63d8bbc9bdfa1d118cfddc5","0.015873015873015872","Apple Tree","This is a beautiful apple tree that will produce delicious apples. It is a deciduous tree that grows to be about 30 feet tall. The leaves are dark green in the summer and turn a beautiful red, orange, and yellow in the fall. Apple trees are known for their strength and durability. They are also a popular choice for shade trees. Apple trees prefer a cool, moist climate and loamy soil. They are best suited for USDA zones 4-8."

Apache Solr FDW का इस्तेमाल करके, पूरे टेक्स्ट को खोजने के लिए यह क्वेरी चलाएं:

SELECT id, score, cymbal_products.product_name, cymbal_products.product_description
FROM ai.hybrid_search(
  ARRAY[
      '{
        "limit": 3,
        "data_type": "external_search_fdw",
        "table_name": "solrindexdemo",
        "key_column": "id",
        "query_text_input": "product_description:cherry"
      }'::JSONB
  ]
) JOIN cymbal_products ON id = cymbal_products.uniq_id;

नतीजों में ध्यान दें कि फ़ुल-टेक्स्ट सर्च में टोकन मैचिंग का इस्तेमाल किया जाता है. इसलिए, नतीजों में वह सब कुछ दिखेगा जिसमें प्रॉडक्ट के ब्यौरे में "चेरी" शब्द शामिल है.

"id","score","product_name","product_description"
"d536e9e823296a2eba198e52dd23e712","0.01639344262295082","Cherry Tree","This is a beautiful cherry tree that will produce delicious cherries. It is an deciduous tree that grows to be about 15 feet tall. The leaves are dark green in the summer and turn a beautiful red in the fall. Cherry trees are known for their beauty and their ability to provide shade and privacy. Cherry trees prefer a cool, moist climate and sandy soil. They are best suited for USDA zones 4-9."
"390cf08feac229e7b752709fd1f943b3","0.016129032258064516","Woven Round Placemat, Set of Twelve, Grass","...These placemats are great for special occasions and holidays, but are also perfect to accessorize your everyday place settings.|Measurements. 15-inch round diameter is the perfect size for most table sizes and shapes.|Pop Colors. Choose from 7 pop woven color placemats including: Black, Cherry, Grass, Taupe, Navy, Sun and Graphite."
"2c9aa7ac98c30abf78dd9c62a68a34e6","0.015873015873015872","48 Scented Wax Melts Wax Cubes: Jelly Belly Jelly Beans Candy Bulk Soy Wax Melts For Candle Warmer, Wax Warmers, Wax Melt Warmers In 8 Pack Set","...From These Flavors: Lemon Drop, Mixed Berry Smoothie, Sizzling Cinnamon, Crushed Pineapple, Juicy Pear, Cotton Candy, Toasted Marshmallow, French Vanilla, Watermelon, Red Apple, Very Cherry, Buttered Popcorn..."

अब ज़्यादा काम के नतीजे पाने के लिए, सिमैंटिक सर्च और एफ़टीएस, दोनों को एक साथ इस्तेमाल किया जा सकता है. मान लें कि हमें ऐसा पेड़ खोजना है जो घर से ज़्यादा लंबा हो और कैलिफ़ोर्निया में पाया जाता हो. हमने क्वेरी को दो हिस्सों में बांटा है, ताकि शाब्दिक मिलान के बजाय सिमैंटिक इंटेंट का इस्तेमाल किया जा सके. वेक्टर सर्च, जानकारी वाले हिस्से को हैंडल करती है: "ऐसा पेड़ जो घर से ज़्यादा लंबा हो सकता है", क्योंकि यह सटीक कीवर्ड की ज़रूरत के बिना स्केल के कॉन्सेप्ट को समझता है. वहीं, फ़ुल-टेक्स्ट सर्च में "कैलिफ़ोर्निया" को एक स्ट्रिक्ट फ़िल्टर के तौर पर इस्तेमाल किया जाता है, ताकि हमें कॉन्सेप्ट के हिसाब से मिलते-जुलते नतीजे के बजाय, सटीक भौगोलिक जानकारी मिल सके.

SELECT id, score, cymbal_products.product_name, cymbal_products.product_description
FROM ai.hybrid_search(
  ARRAY[
    '{
        "data_type": "vector",
        "table_name": "cymbal_products",
        "key_column": "uniq_id",
        "vec_column": "product_embedding",
        "distance_operator": "public.<=>",
        "limit": 3,
        "query_vector": "ai.embedding(''text-embedding-005'', ''tree that can grow taller than a house'')::vector"
      }'::JSONB,
      '{
        "limit": 3,
        "data_type": "external_search_fdw",
        "table_name": "solrindexdemo",
        "key_column": "id",
        "query_text_input": "product_description:California"
      }'::JSONB
  ]
) JOIN cymbal_products ON id = cymbal_products.uniq_id;

अनुमानित नतीजे:

"id","score","product_name","product_description"
"a589fd36a8a20fd9472d2403d6ed692a","0.00819672631147241","California Redwood","This is a beautiful redwood tree that can grow to be over 300 feet tall. It is an evergreen tree that grows in the coastal forests of California. Redwoods are known for their beauty and their strength. They are best suited for USDA zones 7-10."
"ef9432802da24041594c2cf368dfb4d2","0.008064521129029258","Madrone","This is a beautiful madrona tree that can grow to be over 80 feet tall. It is an evergreen tree that grows in the coastal forests of California. Madronas are known for their beauty and their bark. They are best suited for USDA zones 7-10."
"1360d8642bc218e4ea28e9c32b2e1721","0.007936512936504936","California Sycamore","This is a beautiful sycamore tree that can grow to be over 100 feet tall. It is an deciduous tree that grows in the valleys and foothills of California. California sycamores are known for their beauty and their shade. They are best suited for USDA zones 7-10."

12. पर्यावरण को साफ़-सुथरा रखना

लैब का काम पूरा हो जाने के बाद, AlloyDB इंस्टेंस और क्लस्टर मिटा दें.

AlloyDB क्लस्टर और सभी इंस्टेंस मिटाना

अगर आपने AlloyDB का मुफ़्त में आज़माने की सुविधा वाला वर्शन इस्तेमाल किया है. अगर आपको ट्रायल क्लस्टर का इस्तेमाल करके अन्य लैब और संसाधनों की जांच करनी है, तो ट्रायल क्लस्टर को न मिटाएं. आपके पास एक ही प्रोजेक्ट में, दूसरा ट्रायल क्लस्टर बनाने का विकल्प नहीं होगा.

फ़ोर्स विकल्प का इस्तेमाल करके क्लस्टर को डिस्ट्रॉय किया जाता है. इससे क्लस्टर से जुड़े सभी इंस्टेंस भी मिट जाते हैं.

अगर आपका कनेक्शन बंद हो गया है और पिछली सभी सेटिंग मिट गई हैं, तो क्लाउड शेल में प्रोजेक्ट और एनवायरमेंट वैरिएबल तय करें:

gcloud config set project <your project id>
export REGION=us-central1
export ADBCLUSTER=alloydb-hybrid-search
export PROJECT_ID=$(gcloud config get-value project)

क्लस्टर मिटाने के लिए:

gcloud alloydb clusters delete $ADBCLUSTER --region=$REGION --force

अनुमानित कंसोल आउटपुट:

admin_@cloudshell:~ (my-project-93954-gke)$ gcloud alloydb clusters delete $ADBCLUSTER --region=$REGION --force
All of the cluster data will be lost when the cluster is deleted.

Do you want to continue (Y/n)?  Y

Operation ID: operation-1784270790060-656c8ea9fea06-1b93001f-846543e0
Deleting cluster...done.   

AlloyDB के बैकअप मिटाना

क्लस्टर के सभी AlloyDB बैकअप मिटाने के लिए:

for i in $(gcloud alloydb backups list --filter="CLUSTER_NAME: projects/$PROJECT_ID/locations/$REGION/clusters/$ADBCLUSTER" --format="value(name)" --sort-by=~createTime) ; do gcloud alloydb backups delete $(basename $i) --region $REGION --quiet; done

अनुमानित कंसोल आउटपुट:

admin_@cloudshell:~ (my-project-93954-gke)$ for i in $(gcloud alloydb backups list --filter="CLUSTER_NAME: projects/$PROJECT_ID/locations/$REGION/clusters/$ADBCLUSTER" --format="value(name)" --sort-by=~createTime) ; do gcloud alloydb backups delete $(basename $i) --region $REGION --quiet; done
Operation ID: operation-1784271231983-656c904f71e05-1389a145-f101ceee
Deleting backup...done.

अब हम अपने वीएम को बंद कर सकते हैं

GCE वीएम मिटाएं

Cloud Shell में यह कमांड चलाएं:

export GCEVM=instance-1
export ZONE=us-central1-a
gcloud compute instances delete $GCEVM \
    --zone=$ZONE \
    --quiet

अनुमानित कंसोल आउटपुट:

admin_@cloudshell:~ (my-project-93954-gke)$ export GCEVM=instance-1
export ZONE=us-central1-a
gcloud compute instances delete $GCEVM \
    --zone=$ZONE \
    --quiet
Deleted

13. बधाई हो

कोडलैब पूरा करने के लिए बधाई!

हमने क्या-क्या बताया

  • AlloyDB क्लस्टर और प्राइमरी इंस्टेंस को डिप्लॉय करने का तरीका
  • Google Compute Engine वीएम से AlloyDB से कनेक्ट करने का तरीका
  • डेटाबेस बनाने और AlloyDB AI को चालू करने का तरीका
  • डेटाबेस में डेटा लोड करने का तरीका
  • AlloyDB Studio का इस्तेमाल कैसे करें
  • Vertex AI की मदद से एम्बेडिंग जनरेट करना
  • वेक्टर सर्च को बेहतर बनाने के लिए, ScaNN वेक्टर इंडेक्स कैसे बनाएं
  • Apache Solr के लिए, फ़ॉरेन डेटा रैपर (एफ़डीडब्ल्यू) बनाने का तरीका
  • AlloyDB में सिमेंटिक सर्च और Solr में फ़ुल टेक्स्ट सर्च को मिलाकर, हाइब्रिड सर्च करें.

अगले चरण

AlloyDB के ज़्यादा कोडलैब देखने के लिए, कोडलैब की आधिकारिक साइट पर जाएं.postgresql).