১. এক নজরে
এই ল্যাবে, Python ব্যবহার করে ডেটা থেকে ইনসাইট পেতে, BigQuery Studio-তে Python নোটবুক থেকে BigQuery DataFrames ব্যবহার করবেন। আনস্ট্রাকচার্ড টেক্সট ডেটা বিশ্লেষণ ও ভিজ্যুয়ালাইজ করতে Google-এর জেনারেটিভ AI ব্যবহার করুন।
সর্বজনীন গ্রাহকের অভিযোগের ডেটাবেসকে শ্রেণীবদ্ধ ও সংক্ষিপ্তসার করার জন্য আপনি একটি Python নোটবুক তৈরি করবেন। এটি যেকোনও আনস্ট্রাকচার্ড টেক্সট ডেটার উপর কাজ করার জন্য মানিয়ে নেওয়া যেতে পারে।
উদ্দেশ্য
এই ল্যাবে, আপনি কীভাবে নিম্নলিখিত টাস্কগুলি সম্পাদন করবেন তা জানবেন:
- BigQuery Studio-তে Python নোটবুক অ্যাক্টিভেট ও ব্যবহার করা
- BigQuery DataFrames প্যাকেজ ব্যবহার করে BigQuery-তে কানেক্ট করা
- BigQuery ML ব্যবহার করে আনস্ট্রাকচার্ড টেক্সট ডেটা থেকে এম্বেডিং তৈরি করা এবং Vertex AI-তে টেক্সট এম্বেডিং এন্ডপয়েন্টে কানেক্ট করা
- BigQuery ML ব্যবহার করে এম্বেডিং ক্লাস্টার করা
- BigQuery ML-এর মাধ্যমে LLM দিয়ে ক্লাস্টারগুলির সারসংক্ষেপ তৈরি করা
২. প্রয়োজনীয়তা
শুরু করার আগে
এই কোডল্যাবের নির্দেশাবলী অনুসরণ করতে, আপনার BigQuery Studio চালু করা একটি Google Cloud প্রোজেক্ট এবং একটি কানেক্ট করা বিলিং অ্যাকাউন্ট থাকতে হবে।
- Google Cloud Console-এ, প্রোজেক্ট বাছাইকারী পৃষ্ঠায়, Google Cloud প্রোজেক্ট বেছে নিন বা তৈরি করুন
- আপনার Google Cloud প্রোজেক্টের জন্য বিলিং চালু আছে কিনা তা নিশ্চিত করুন। কীভাবে কোনও প্রোজেক্টে বিলিং চালু আছে কিনা তা চেক করবেন তা জানুন
- অ্যাসেট ম্যানেজমেন্টের জন্য BigQuery Studio চালু করতে নির্দেশাবলী অনুসরণ করুন।
BigQuery Studio প্রস্তুত করা
একটি খালি নোটবুক তৈরি করে সেটিকে রানটাইমের সাথে কানেক্ট করুন।
- Google Cloud Console-এ BigQuery Studio-তে যান।
- + বোতামের পাশে থাকা ▼ আইকনে ক্লিক করুন।
- Python নোটবুক বিকল্প বেছে নিন।
- টেমপ্লেট সিলেক্টর বন্ধ করুন।
- নতুন কোড সেল তৈরি করতে + কোড বিকল্প বেছে নিন।
- কোড সেল থেকে BigQuery DataFrames প্যাকেজের লেটেস্ট ভার্সন ইনস্টল করুন। নিম্নলিখিত কমান্ডটি টাইপ করুন।
কোড সেল রান করাতে 🞂 বোতামে ক্লিক করুন অথবা Shift + Enter প্রেস করুন।%pip install --upgrade bigframes --quiet
৩. পাবলিক ডেটাসেট পড়া
নতুন কোড সেলে নিম্নলিখিত কোডটি রান করিয়ে BigQuery DataFrames প্যাকেজটি ইনিশিয়ালাইজ করুন:
import bigframes.pandas as bpd
bpd.options.bigquery.ordering_mode = "partial"
মনে রাখবেন: এই টিউটোরিয়ালে, আমরা পরীক্ষামূলক "আংশিক অর্ডারিং মোড" ব্যবহার করি, যা পান্ডা-সদৃশ ফিল্টারিংয়ের সাথে ব্যবহার করা হলে আরও কার্যকর কোয়েরি করার অনুমতি দেয়। কিছু pandas ফিচারের জন্য কঠোরভাবে সাজানো বা ইন্ডেক্স করার প্রয়োজন হয়, সেগুলি কাজ নাও করতে পারে।
গ্রাহকের অভিযোগ সংক্রান্ত ডেটাবেস
Google Cloud-এর পাবলিক ডেটাসেট প্রোগ্রামের মাধ্যমে BigQuery-তে গ্রাহকের অভিযোগ সংক্রান্ত ডেটাবেস প্রদান করা হয়। এটি হল গ্রাহকদের আর্থিক প্রোডাক্ট ও পরিষেবা সংক্রান্ত অভিযোগের সংগ্রহ এবং এই ডেটা মার্কিন যুক্তরাষ্ট্রের Consumer Financial Protection Bureau সংগ্রহ করে।
BigQuery-তে, গ্রাহকের অভিযোগের ডেটাবেস বিশ্লেষণ করতে, bigquery-public-data.cfbp_complaints.complaint_database table কোয়েরি করুন। কোয়েরি স্ট্রিং বা টেবিল আইডি থেকে DataFrame তৈরি করতে bigframes.pandas.read_gbq() পদ্ধতি ব্যবহার করুন।
"feedback" নামের DataFrame তৈরি করতে, নতুন কোড সেলে নিম্নলিখিত কোডটি রান করান:
feedback = bpd.read_gbq(
"bigquery-public-data.cfpb_complaints.complaint_database"
)
DataFrame সম্পর্কে প্রাথমিক তথ্য খুঁজে দেখা
ডেটার একটি ছোট স্যাম্পেল ডাউনলোড করতে DataFrame.peek() পদ্ধতি ব্যবহার করুন।
এই সেল রান করুন:
feedback.peek()
প্রত্যাশিত আউটপুট:
date_received product ... timely_response consumer_disputed complaint_id
0 2014-03-05 Bank account or service ... True False 743665
1 2014-01-21 Bank account or service ... True False 678608
2 2020-12-31 Debt collection ... True <NA> 4041190
3 2014-02-12 Debt collection ... True False 714350
4 2015-02-23 Debt collection ... True False 1251358
মনে রাখবেন: head()-এর জন্য অর্ডার করতে হয় এবং আপনি ডেটার নমুনা দেখতে চাইলে, সাধারণত peek()-এর তুলনায় এটি কম কার্যকর।
pandas-এর মতোই, উপলভ্য সব কলাম ও তাদের সংশ্লিষ্ট ডেটা টাইপ দেখতে DataFrame.dtypes প্রপার্টি ব্যবহার করুন। এগুলি pandas-এর সাথে মানানসই উপায়ে এক্সপোজ করা হয়।
এই সেল রান করুন:
feedback.dtypes
প্রত্যাশিত আউটপুট:
date_received date32[day][pyarrow]
product string[pyarrow]
subproduct string[pyarrow]
issue string[pyarrow]
subissue string[pyarrow]
consumer_complaint_narrative string[pyarrow]
company_public_response string[pyarrow]
company_name string[pyarrow]
state string[pyarrow]
zip_code string[pyarrow]
tags string[pyarrow]
consumer_consent_provided string[pyarrow]
submitted_via string[pyarrow]
date_sent_to_company date32[day][pyarrow]
company_response_to_consumer string[pyarrow]
timely_response boolean
consumer_disputed boolean
complaint_id string[pyarrow]
dtype: object
DataFrame.describe() পদ্ধতিটি DataFrame থেকে কিছু প্রাথমিক পরিসংখ্যান কোয়েরি করে। এই DataFrame-এ কোনও সংখ্যাসূচক কলাম না থাকায়, এটি শূন্য নয় এমন ভ্যালুর সংখ্যা এবং আলাদা ভ্যালুর সংখ্যার একটি সারসংক্ষেপ দেখায়।
এই সেল রান করুন:
# Exclude some of the larger columns to make the query more efficient.
feedback.drop(columns=[
"consumer_complaint_narrative",
"company_public_response",
"company_response_to_consumer",
]).describe()
প্রত্যাশিত আউটপুট:
product subproduct issue subissue company_name state ... timely_response consumer_disputed complaint_id
count 3458906 3223615 3458906 2759004 3458906 3417792 ... 3458906 768399 3458906
nunique 18 76 165 221 6694 63 ... 2 2 3458906
৪. ডেটা এক্সপ্লোর করা
প্রকৃত অভিযোগগুলি দেখার আগে, ডেটা ভিজ্যুয়ালাইজ করতে DataFrame-এ পান্ডা-সদৃশ পদ্ধতি ব্যবহার করুন।
DataFrame ভিজ্যুয়ালাইজ করা
DataFrame.plot.hist()-এর মতো বেশ কিছু বিল্ট-ইন ভিজ্যুয়ালাইজেশন পদ্ধতি আছে। যেহেতু এই ডেটাফ্রেমে বেশিরভাগই স্ট্রিং ও বুলিয়ান ডেটা থাকে, তাই বিভিন্ন কলাম সম্পর্কে আরও জানতে আমরা প্রথমে কিছু অ্যাগ্রিগেশন করতে পারি।
প্রতিটি রাজ্য থেকে কতগুলি অভিযোগ এসেছে তা গণনা করুন।
complaints_by_state = (
feedback.groupby(
"state", as_index=False,
).size()
.rename(columns={"size": "total_complaints"})
.sort_values(by="total_complaints", ascending=False)
)
DataFrame.to_pandas() পদ্ধতি ব্যবহার করে এটিকে pandas DataFrame-এ কনভার্ট করুন।
complaints_pd = complaints_by_state.head(10).to_pandas()
এই ডাউনলোড করা DataFrame-এ pandas ভিজ্যুয়ালাইজেশন পদ্ধতি ব্যবহার করুন।
complaints_pd.plot.bar(x="state", y="total_complaints")

অন্যান্য ডেটাসেটের সাথে যোগ দিন
আগে, আপনি রাজ্যভিত্তিক অভিযোগ দেখেছেন, কিন্তু এতে গুরুত্বপূর্ণ প্রসঙ্গ বাদ পড়ে গেছে। কিছু রাজ্যের জনসংখ্যা অন্যান্য রাজ্যের তুলনায় বেশি। মার্কিন যুক্তরাষ্ট্রের জনগণনা ব্যুরোর আমেরিকান কমিউনিটি সার্ভে এবং bigquery-public-data.geo_us_boundaries.states টেবিলের মতো জনসংখ্যা সংক্রান্ত ডেটাসেটের সাথে যোগ দিন।
us_states = bpd.read_gbq("bigquery-public-data.geo_us_boundaries.states")
us_survey = bpd.read_gbq("bigquery-public-data.census_bureau_acs.state_2020_5yr")
# Ensure there are leading 0s on GEOIDs for consistency across tables.
us_states = us_states.assign(
geo_id=us_states["geo_id"].str.pad(2, fillchar="0")
)
us_survey = us_survey.assign(
geo_id=us_survey["geo_id"].str.pad(2, fillchar="0")
)
আমেরিকান কমিউনিটি সার্ভে GEOID-এর মাধ্যমে রাজ্যগুলিকে শনাক্ত করে। দুই অক্ষরের রাজ্য কোড অনুযায়ী জনসংখ্যা পেতে, states টেবিলের সাথে যোগ দিন।
pops = us_states.set_index("geo_id")[["state"]].join(
us_survey.set_index("geo_id")[["total_pop"]]
)
এখন, অভিযোগের সংখ্যার সাথে জনসংখ্যার তুলনা করতে, অভিযোগের ডেটাবেসে এটি যোগ করুন।
complaints_and_pops = complaints_by_state.set_index("state").join(
pops.set_index("state")
)
অভিযোগের সংখ্যার সাথে রাজ্যের জনসংখ্যা তুলনা করতে একটি স্ক্যাটার প্লট তৈরি করুন।
(
complaints_and_pops
.to_pandas()
.plot.scatter(x="total_pop", y="total_complaints")
)

জনসংখ্যার সাথে অভিযোগের সংখ্যা তুলনা করলে, কয়েকটি রাজ্যকে আউটলায়ার বলে মনে হয়। পাঠকদের জন্য এটি একটি অনুশীলন হিসেবে ছেড়ে দেওয়া হয়েছে যাতে তারা এই পয়েন্টগুলি শনাক্ত করতে পয়েন্ট লেবেল সহ প্লট করতে পারে। একইভাবে, এটি কেন হতে পারে তার কিছু হাইপোথিসিস তৈরি করুন (যেমন, আলাদা আলাদা ডেমোগ্রাফি, আলাদা আলাদা সংখ্যক আর্থিক পরিষেবা কোম্পানি ইত্যাদি) এবং সেগুলি পরীক্ষা করুন।
৫. এম্বেডিং গণনা করা
প্রায়শই, গুরুত্বপূর্ণ তথ্য আনস্ট্রাকচার্ড ডেটার মধ্যে লুকানো থাকে, যেমন টেক্সট, অডিও বা ছবি। এই উদাহরণে, অভিযোগের ডেটাবেসে থাকা বেশিরভাগ প্রয়োজনীয় তথ্য অভিযোগের টেক্সট কন্টেন্টে রয়েছে।
AI এবং আবেগ বিশ্লেষণ, "বাগ অফ ওয়ার্ডস" ও word2vec-এর মতো ঐতিহ্যবাহী টেকনিক আনস্ট্রাকচার্ড ডেটা থেকে কিছু পরিমাণগত তথ্য এক্সট্র্যাক্ট করতে পারে। আরও সম্প্রতি, "ভেক্টর এম্বেডিং" মডেল, যা LLM-এর সাথে ঘনিষ্ঠভাবে সম্পর্কিত, তা টেক্সটের শব্দার্থ সংক্রান্ত তথ্যকে উপস্থাপন করে এমন ফ্লোটিং পয়েন্ট সংখ্যার একটি ক্রম তৈরি করতে পারে।
ডেটাবেসের সাবসেট বেছে নিন
ভেক্টর এম্বেডিং মডেল চালানোর জন্য অন্যান্য অপারেশনের তুলনায় বেশি রিসোর্স ব্যবহার করা হয়। খরচ ও কোটা সংক্রান্ত সমস্যা কমাতে, এই টিউটোরিয়ালের বাকি অংশের জন্য ডেটার একটি সাবসেট বেছে নিন।
import bigframes.pandas as bpd
bpd.options.bigquery.ordering_mode = "partial"
feedback = bpd.read_gbq(
"bigquery-public-data.cfpb_complaints.complaint_database"
)
# Note: if not using ordering_mode = "partial", you must specify these in read_gbq
# for these to affect query efficiency.
# feedback = bpd.read_gbq(
# "bigquery-public-data.cfpb_complaints.complaint_database",
# columns=["consumer_complaint_narrative"],
# filters= [
# ("consumer_complaint_narrative", "!=", ""),
# ("date_received", "==", "2022-12-01")])
feedback.shape
মোট ডেটাবেসে প্রায় ৩৫ লক্ষ সারি থাকার বিপরীতে ২০২২-১২-০১ তারিখে প্রায় ১,০০০ অভিযোগ জমা পড়েছে (feedback.shape-এর সাথে চেক করুন)।
শুধুমাত্র ০১-১২-২০২২ তারিখের ডেটা এবং শুধুমাত্র consumer_complaint_narrative কলাম বেছে নিন।
import datetime
feedback = feedback[
# Filter rows by passing in a boolean Series.
(feedback["date_received"] == datetime.date(2022, 12, 1))
& ~(feedback["date_received"].isnull())
& ~(feedback["consumer_complaint_narrative"].isnull())
& (feedback["consumer_complaint_narrative"] != "")
& (feedback["state"] == "CA")
# Uncomment the following if using free credits for a workshop.
# Billing accounts with free credits have limited Vertex AI quota.
# & (feedback["product"] == "Mortgage")
][
# Filter columns by passing in a list of strings.
["consumer_complaint_narrative"]
]
feedback.shape
pandas-এর drop_duplicates পদ্ধতিতে সারির সম্পূর্ণ অর্ডারিং প্রয়োজন হয় কারণ এটি প্রথম বা শেষ ম্যাচিং সারি বেছে নেওয়ার চেষ্টা করে এবং এর সাথে যুক্ত ইন্ডেক্সকে সেভ করে।
এর পরিবর্তে, ডুপ্লিকেট রো সরানোর জন্য groupby মেথডে কল করে এগ্রিগেট করুন।
feedback = (
feedback.groupby("consumer_complaint_narrative", as_index=False)
.size()
)[["consumer_complaint_narrative"]]
feedback.shape
এম্বেডিং জেনারেট করা
BigQuery DataFrames, TextEmbeddingGenerator ক্লাস-এর মাধ্যমে এম্বেডিং ভেক্টর তৈরি করে। এটি BigQuery ML-এর ML.GENERATE_EMBEDDING মেথডের উপর ভিত্তি করে তৈরি করা হয়েছে, যা Vertex AI-এর দেওয়া টেক্সট এম্বেডিং মডেল কল করে।
from bigframes.ml.llm import TextEmbeddingGenerator
embedding_model = TextEmbeddingGenerator(
model_name="text-embedding-004"
)
feedback_embeddings = embedding_model.predict(feedback)
এমবেডিং কেমন দেখতে হয় তা দেখে নিন। টেক্সট এম্বেডিং মডেল টেক্সট থেকে যা বুঝেছে, এই ভেক্টরগুলি তার সেম্যান্টিক অর্থকে উপস্থাপন করে।
feedback_embeddings.peek()
প্রত্যাশিত আউটপুট:
ml_generate_embedding_result \
0 [ 7.36380890e-02 2.11779331e-03 2.54309829e-...
1 [-1.10935252e-02 -5.53950183e-02 2.01338865e-...
2 [-7.85628427e-03 -5.39347418e-02 4.51385677e-...
3 [ 0.02013054 -0.0224789 -0.00164843 0.011354...
4 [-1.51684484e-03 -5.02693094e-03 1.72322839e-...
এইসব ভেক্টরে অনেক ডাইমেনশন থাকে। একটি এম্বেডিং ভেক্টর দেখুন:
feedback_embeddings["ml_generate_embedding_result"].peek().iloc[0]
"আংশিক সাফল্য" চুক্তির অধীনে এম্বেডিং জেনারেশন কাজ করে। এর অর্থ হল, কিছু সারিতে সমস্যা থাকতে পারে এবং এম্বেডিং তৈরি নাও হতে পারে। 'ml_generate_embedding_status' কলামে সমস্যার মেসেজ দেখানো হয়। খালি মানে কোনও সমস্যা নেই।
যেসব সারিতে কোনও সমস্যা হয়নি, শুধুমাত্র সেগুলি অন্তর্ভুক্ত করতে এম্বেডিং ফিল্টার করুন।
mask = feedback_embeddings["ml_generate_embedding_status"] == ""
valid_embeddings = feedback_embeddings[mask]
valid_embeddings.shape
৬. টেক্সট এম্বেডিং ব্যবহার করে ক্লাস্টার করা
এখন, k-means ব্যবহার করে এম্বেডিং ক্লাস্টার করুন। এই ডেমোর জন্য, গ্রুপের একটি অনির্দিষ্ট সংখ্যা (অর্থাৎ সেন্ট্রয়েড) ব্যবহার করুন। প্রোডাকশন কোয়ালিটি সলিউশনকে সিলুয়েট পদ্ধতির মতো কোনও টেকনিক ব্যবহার করে সেন্ট্রয়েডের সংখ্যা টিউন করতে হবে।
from bigframes.ml.cluster import KMeans
num_clusters = 5
cluster_model = KMeans(n_clusters=num_clusters)
cluster_model.fit(valid_embeddings["ml_generate_embedding_result"])
clusters = cluster_model.predict(valid_embeddings)
clusters.peek()
এম্বেড করা সংক্রান্ত কোনও সমস্যা থাকলে তা সরিয়ে দিন।
mask = clusters["ml_generate_embedding_status"] == ""
clusters = clusters[mask]
প্রতিটি সেন্ট্রয়েড অনুযায়ী কমেন্টের ডিস্ট্রিবিউশন এক ঝলকে দেখে নিন।
clusters.groupby("CENTROID_ID").size()
৭. ক্লাস্টারগুলির সারসংক্ষেপ করো
প্রতিটি সেন্ট্রয়েডের সাথে যুক্ত কিছু কমেন্ট ফিড করুন এবং Gemini-কে অভিযোগের সারসংক্ষেপ করতে বলুন। প্রম্পট ইঞ্জিনিয়ারিং একটি নতুন ক্ষেত্র, তবে ইন্টারনেটে এর ভালো উদাহরণ রয়েছে, যেমন https://www.promptingguide.ai/।
from bigframes.ml.llm import GeminiTextGenerator
preamble = "What is the main concern in this list of user complaints:"
suffix = "Write the main issue using a formal tone."
# Now let's sample the raw comments and get the LLM to summarize them.
prompts = []
for centroid_id in range(1, num_clusters + 1):
cluster = clusters[clusters["CENTROID_ID"] == centroid_id]
comments = "\n".join(["- {0}".format(x) for x in cluster.content.peek(40)])
prompts.append("{}:\n{}\n{}".format(preamble, comments, suffix))
prompt_df = bpd.DataFrame(prompts)
gemini = GeminiTextGenerator(model_name="gemini-1.5-flash-001")
issues = gemini.predict(X=prompt_df, temperature=0.0)
issues.peek()
সারসংক্ষেপ থেকে রিপোর্ট লেখার জন্য Gemini ব্যবহার করুন।
from IPython.display import display, Markdown
prompt = "Turn this list of issues into a short, concise report:"
for value in issues["ml_generate_text_llm_result"]:
prompt += "- {}".format(value)
prompt += "Using a formal tone, write a markdown text format report."
summary_df = bpd.DataFrame(([prompt]))
summary = gemini.predict(X=summary_df, temperature=0.0)
report = (summary["ml_generate_text_llm_result"].values[0])
display(Markdown(report))
৮. অপ্রয়োজনীয়গুলি মুছুন
এই টিউটোরিয়ালের জন্য আপনি নতুন Google Cloud প্রোজেক্ট তৈরি করে থাকলে, তৈরি করা টেবিল বা অন্যান্য রিসোর্সের জন্য অতিরিক্ত চার্জ এড়াতে, আপনি এটি মুছে দিতে পারেন।
৯. অভিনন্দন!
আপনি BigQuery DataFrames ব্যবহার করে স্ট্রাকচার্ড ও আনস্ট্রাকচার্ড ডেটা বিশ্লেষণ করেছেন। এই প্রসেসে আপনি Google Cloud-এর সর্বজনীন ডেটাসেট, BigQuery Studio-তে Python নোটবুক, BigQuery ML, Vertex AI এবং BigQuery Studio-র ন্যাচারাল ল্যাঙ্গুয়েজ থেকে Python ফিচার এক্সপ্লোর করেছেন। আপনি অসাধারণ কাজ করেছেন!
পরবর্তী ধাপ
- আপনার নোটবুকে Python কোড জেনারেট করার চেষ্টা করুন। BigQuery Studio-তে Python নোটবুক Colab Enterprise দ্বারা পরিচালিত হয়। পরামর্শ: টেস্ট ডেটা তৈরি করার জন্য সাহায্য চাওয়া আমার কাছে খুবই উপযোগী বলে মনে হয়।
- GitHub-এ BigQuery DataFrames-এর নমুনা নোটবুক এক্সপ্লোর করুন।
- BigQuery Studio-তে নোটবুক চালানোর জন্য শিডিউল তৈরি করুন।
- BigQuery-র সাথে থার্ড-পার্টি Python প্যাকেজ ইন্টিগ্রেট করতে BigQuery DataFrames সহ রিমোট ফাংশন ডেপ্লয় করুন।