Öncelikle şu terminolojiyi bir düzeltelim. Tabloyu "mixlemek" değil, dataseti randomize etmek veya shuffle etmek diyoruz ona. PDF formatı veri manipülasyonu için tasarlanmış bir format değil, sadece çıktı almak için yaratılmış ölü bir formattır. PDF içindeki o 3000 kelimeyi doğrudan randomize edemezsin.
Bunu çözmek için önce o unstructured veriyi, Excel veya CSV gibi structured bir tabloya extract etmen şart. İnternetteki basit PDF to Excel converter araçları ile bunu kolayca yapabilirsin. Veriyi Excel ortamına aldıktan sonra işlem çok basic. Yeni bir column açıp içine RAND() veya Türkçe Excel kullanıyorsan S_SAYI_ÜRET() fonksiyonunu basıyorsun ve tüm satırlara uyguluyorsun. Bu fonksiyon her satır için 0 ile 1 arasında tamamen random bir değer generate eder. Sonra tüm dataseti bu yeni sütuna göre sort ettiğin an, kelimelerin kusursuz bir şekilde shuffle edilmiş olur.
Eğer işin biraz daha teknik tarafına girmek istersen, asıl best practice iki satır Python kodu yazmaktır. Pandas kütüphanesiyle veriyi okuyup dataframe üzerinden sample metodunu çağırdığında tüm yapıyı anında randomize edebilirsin. Bu arada kelime ezberlerken alfabetik sıradan çıkıp random bir distribution kullanman, cognitive load kısmını yönetmek ve learning curve optimizasyonu yapmak açısından kesinlikle doğru bir yaklaşım. Beyin patternleri sever ama ezberde sabit pattern, kalıcı öğrenmenin düşmanıdır.
Kaynaklar
- Microsoft. Rand Function. Alındığı Yer: | Arşiv Bağlantısı
- Pandas. Pandas.dataframe.sample. Alındığı Yer: | Arşiv Bağlantısı